Модели Claude Opus 5 и GPT-5.6 относятся к сегменту премиум-класса на рынке моделей искусственного интеллекта. Именно к этим моделям обращаются, когда задача кодирования охватывает множество файлов, исследовательское задание сложно разъяснить или когда первый черновой вариант должен выдержать тщательную редакционную проверку.
Полезным критерием сравнения является не просто место в рейтинге. Речь идет о том, как каждая модель справляется с программированием, написанием текстов, логическим мышлением, обработкой длинных документов, использованием инструментов и затратами в условиях реальных ограничений задачи.
Прежде чем продолжить, следует обратить внимание на одну деталь, касающуюся наименования. В OpenAI обозначение GPT-5.6 используется как название семейства, так и в качестве псевдонима API. В это семейство входят Sol, Terra и Luna, тогда как gpt-5.6 псевдоним, перенаправляющий на «Флагман» GPT-5.6 Sol. В рамках данного сравнения термин “GPT-5.6” относится, в первую очередь, к GPT-5.6 Sol.
Официальные технические характеристики позволяют прояснить вопросы, касающиеся цены, контекста и доступных инструментов. Чтобы оценить качество результатов, мы провели четыре теста API с одинаковыми запросами, охватывающие программирование, написание текстов, анализ данных и синтез исходного кода. Модели разделили задачи между собой поровну (2:2), поэтому полезной частью данного сравнения является именно конечный результат работы, а не надуманная общая оценка.
Хотите сравнить конкретные модели, не оплачивая сначала две отдельные подписки? Как Claude Opus 5, так и GPT-5.6 Sol включены в список GLBGPT. Запустите одну и ту же задачу на обеих моделях, сравните результаты и оставьте ту модель, которая требует меньшей корректировки.
Claude Opus 5 против GPT-5.6: краткий ответ
В нашем наборе из четырёх задач по API Broly не было единого победителя. Группа GPT-5.6 Sol продемонстрировала более высокие результаты в области кодирования и анализа данных. Группа Claude Opus 5 представила более качественно отредактированный текст и более удачный обзор результатов исследования.
Выбирайте исходя из того, какой конечный результат вам нужен. Модель GPT-5.6 Sol давала более лаконичные и готовые к принятию решений ответы в задачах со структурированным техническим содержанием; модель Claude Opus 5 — более развернутые и редакционно отполированные ответы в задачах с преобладанием языкового компонента. Цена, поддержка инструментов и использование токенов по-прежнему имеют значение, но они не должны заменять анализ фактических результатов, приведенных ниже.
$5 за миллион входных токенов и $25 за миллион выходных токенов по стандартным тарифам API Anthropic.
В разделе «OpenAI» перечислены такие функции, как поиск в Интернете, поиск файлов, интерпретатор кода, удалённая оболочка, использование компьютера, MCP, поиск инструментов и многое другое.
Что такое Claude Opus 5 и что такое GPT-5.6?
Запуск Claude Opus 5 состоялся 24 июля 2026 года. Anthropic позиционирует эту модель как самую мощную из серии Opus на сегодняшний день, ориентированную на работу с долгосрочными агентами, сложное программирование, профессиональную интеллектуальную деятельность и многодневные корпоративные задачи. Разработчики могут использовать псевдоним API claude-opus-5 через платформу Claude. В Anthropic также указана доступность через AWS, Google Cloud и Microsoft Foundry.
В собственных приложениях Anthropic Opus 5 доступен пользователям тарифных планов Pro, Max, Team и Enterprise. Он не указан в качестве модели для бесплатного тарифного плана. В рекламных материалах компании особое внимание уделяется управлению задачами, выполнению сложных задач с использованием нескольких инструментов, работе с компьютером, а также работе с таблицами, слайдами и документами. Разработчики, сравнивающие его возможности в области программирования с другими премиум-моделями, также могут ознакомиться с руководством GLBGPT по Лучшие модели искусственного интеллекта для кодирования полезно.
9 июля 2026 года компания OpenAI представила линейку GPT-5.6 в рамках ChatGPT, Codex и API OpenAI. Sol — это флагманская модель, Terra обеспечивает баланс между производительностью и стоимостью, а Luna предназначена для выполнения недорогих задач с большим объемом данных. Это различие важно, поскольку эти три модели отличаются как по цене, так и по целевым рабочим нагрузкам.
GPT-5.6 Sol — это модель логического мышления, предназначенная для выполнения сложных профессиональных задач. OpenAI уделяет особое внимание программированию, работе с компьютером, научным исследованиям, кибербезопасности, фронтенд-дизайну и задачам, требующим активного участия. Если программирование является основной причиной, по которой вы рассматриваете эту модель, сравнение будет более полезным в сочетании с руководством, посвященным конкретным задачам в области лучшая модель ChatGPT для кодирования а не общий рейтинг моделей.
Краткое сравнение моделей Claude Opus 5 и GPT-5.6
| Категория | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|
| Разработчик | Антропный | OpenAI |
| Дата выхода | 24 июля 2026 года | 9 июля 2026 года |
| Модель API | claude-opus-5 | gpt-5.6-sol; ; gpt-5.6 псевдоним маршрутов к Солу |
| Первичное позиционирование | Агенты с длительным сроком действия, передовое программирование, корпоративная деятельность и интеллектуальный труд | Сложная профессиональная деятельность, программирование, научные исследования, работа с компьютером и агенты, активно использующие инструменты |
| Окно контекста | На текущей странице Opus проекта Anthropic указано 1 млн токенов, хотя на проанализированной странице смешаны текущие и более ранние обозначения Opus | 1 050 000 токенов |
| Максимальная мощность | Эта информация не указана на проанализированных страницах, посвященных запуску и продукту Opus 5 | 128 000 токенов |
| Вход и выход | В Anthropic приведены примеры задач, связанных с визуальным восприятием и работой с компьютером; точную схему см. в справочнике по модели API в режиме реального времени | Ввод текста и изображений; вывод текста |
| Поддержка инструментов и агентов | Координация работы нескольких инструментов, использование компьютеров, контроль затрат труда и длительная работа агентов | Вызов функций, структурированный вывод, поиск в Интернете и файлах, интерпретатор кода, хостируемая оболочка, использование компьютера, MCP, программный вызов инструментов и бета-версия мультиагентной системы |
| Стандартная цена по API | $5 — ввод / $0,50 — чтение из кэша / $6,25 — запись в кэш за пять минут / $25 — вывод | $5 — вход / $0,50 — вход с кэшированием / $6,25 — запись в кэш / $30 — выход |
| Официальный доступ для потребителей | Claude Pro, Max, Team и Enterprise | ChatGPT Plus, Pro, Business и Enterprise — набор функций зависит от тарифного плана |
| Наличие GLBGPT | Страница модели Exact Claude Opus 5, проверенная 27 июля 2026 года | Страница модели Exact GPT-5.6 Sol, проверенная 27 июля 2026 года |
Основное преимущество в плане технических характеристик принадлежит GPT-5.6, поскольку OpenAI предоставляет более четкую информацию о контексте на уровне модели, выводах, модальности и таблице инструментов. Это преимущество в плане документации, а не доказательство того, что GPT-5.6 генерирует более качественные ответы. На текущей странице Opus для Anthropic указано контекстное окно объемом 1 млн токенов, однако на странице, проанализированной для данного проекта, по-прежнему присутствуют смешанные обозначения версий Opus, поэтому в таблице сохраняется это оговорка.
Claude Opus 5 против GPT-5.6: тестовые результаты и технические характеристики
Обе компании опубликовали впечатляющие результаты по запуску, однако их сводные таблицы не являются объективным сравнением «один на один». Различные настройки параметров, ограничения по затратам, инструментальные среды и наборы данных для сравнения могут повлиять на результат. Тесты поставщиков служат полезным свидетельством того, что именно оптимизировала каждая из компаний; однако они не заменяют независимого парного тестирования.
Claude Opus 5
- Производительность по тесту Frontier-Bench v0.1 превысила показатели Opus 4.8 более чем в два раза при меньшей стоимости выполнения одной задачи.
- По данным, она показала результат примерно в три раза выше, чем у модели, занявшей второе место, на наборе данных ARC-AGI 3.
- По данным отчета, показатель успешности выполнения задач превысил показатель следующей по эффективности модели на платформе Zapier AutomationBench примерно в 1,5 раза при одинаковой стоимости за задачу.
- Результат оказался на уровне 0,51 TP40T от максимального показателя Fable 5 в тесте CursorBench 3.2 при примерно вдвое меньшей стоимости выполнения одной задачи при максимальной нагрузке.
GPT-5.6 Sol
- 88.8% в программе Terminal-Bench 2.1.
- 72,71 TP40T в DeepSWE v1.1.
- 64,61 TP40T на SWE-Bench Pro.
- 90.4% на сайте BrowseComp.
- 62.6% на OSWorld 2.0.
Не стоит рассматривать эти списки как подсчёт победителей. В отчётах Anthropic основное внимание уделяется затратам на выполнение одной успешной задачи и масштабируемости усилий. OpenAI публикует более прямые процентные показатели по задачам, связанным с программированием, просмотром веб-страниц и работой на компьютере. Более обоснованный вывод заключается в том, что оба поставщика ориентируются на агентов и сложную профессиональную работу, а в публичных результатах используются разные стили представления данных.
Независимое тестирование имеет наибольшее значение именно для письменной речи, поскольку стандартные тесты зачастую не учитывают интонацию, удобство чтения и затраты на доработку текста. Если написание текстов является вашим основным направлением использования, сравните эти две модели с более широким списком кандидатов из Инструменты для написания текстов с использованием искусственного интеллекта используя один из ваших реальных набросков, а не общий промпт.
Claude Opus 5 против GPT-5.6: цены и доступ
По стандартным тарифам прямого API, пересмотренным 27 июля 2026 года, обе модели имеют одинаковые указанные цены на входные ресурсы и кэш. У модели Claude Opus 5 более низкая цена на выходные токены: $25 за миллион выходных токенов по сравнению с $30 у модели GPT-5.6 Sol.
| Стандартная стоимость API за 1 млн токенов | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|
| Вход | $5.00 | $5.00 |
| Ввод из кэша / чтение из кэша | $0.50 | $0.50 |
| Запись в кэш | $6.25 для пятиминутной записи в кэш | $6.25 |
| Выход | $25.00 | $30.00 |
| Партия | По данным Anthropic, пакетная обработка может снизить затраты на токены, котирующиеся на бирже, на 50% | $2.50 вход / $0.25 вход с кэшированием / $3.125 запись в кэш / $15 выход |
| Вариант с более высокой скоростью | Скорость в быстром режиме составляет примерно 2,5× от стандартной скорости при 2× базовой частоте | Приоритетное ценообразование: $10 — вход / $1 — вход из кэша / $12,50 — запись в кэш / $60 — выход |
У GPT-5.6 есть одно дополнительное правило ценообразования с учетом длительного контекста. Если запрос содержит более 272 000 входных токенов, OpenAI взимает за весь запрос плату, равную удвоенной стоимости входных данных и 1,5-кратной стоимости выходных данных. Вызовы инструментов могут приводить к дополнительным затратам, поэтому цена за токен сама по себе не дает представления о том, во сколько обойдётся запуск агента.
Более низкая цена вывода Claude имеет значение для длинных отчетов и ответов с большим объемом кода, однако разница в $5 на миллион выводимых токенов сама по себе не должна стать определяющим фактором при принятии решения о покупке. Модель, требующая двух повторных попыток, может обойтись дороже, чем модель с более высокой заявленной ценой, которая выполняет задачу правильно с первой попытки. Практической единицей измерения является стоимость одной успешно выполненной задачи.
Официальный доступ для пользователей также отличается от доступа через API. Opus 5 доступен в тарифных планах Anthropic «Pro», «Max», «Team» и «Enterprise». GPT-5.6 Sol доступен в рамках соответствующих тарифных планов ChatGPT, Codex и через API, при этом режимы и ограничения варьируются в зависимости от тарифного плана. Читатели, которые пока не хотят выбирать одного из провайдеров, могут сравнить обе конкретные модели с помощью Модельный хаб GLBGPT. Страницы с информацией об этих двух конкретных моделях были доступны на сайте на момент проверки 27 июля 2026 года.
Если ни одна из моделей премиум-класса не соответствует вашему бюджету или предпочтениям в отношении интерфейса, сравните более широкий ассортимент Альтернативы Клода и Альтернативы ChatGPT прежде чем оплатить вторую подписку.
Сравнение Claude Opus 5 и GPT-5.6 в реальных условиях
27 июля 2026 года мы выполнили четыре полных задания с одинаковым запросом с помощью API, совместимого с Anywhere Broly OpenAI. Конкретные модели были следующими: claude-opus-5 и gpt-5.6-sol. В каждом сравнении использовался один и тот же запрос, температура 0,2, один запрос на каждую модель и отсутствие повторных попыток. Победитель задачи определялся по качеству вывода и трудоемкости корректировки; показатели эффективности оценивались по количеству использованных токенов и локальному времени от начала до конца.
Кодирование и отладка
Тот же полный запрос на английском языке, тот же маршрут API, совместимый с Broly OpenAI, температура 0,2, один вызов на модель и отсутствие повторных попыток.
Посмотреть точную формулировку задания
Вы проводите анализ сервиса обработки данных на Python, который считывает JSON-файл объемом в несколько гигабайт, преобразует каждую запись и вызывает внешний API. Текущая версия загружает весь файл в память, немедленно повторяет попытку при каждом сбое, может дублировать успешные записи в API после истечения таймаута и не поддерживает восстановление по контрольным точкам. Опишите ровно шесть пронумерованных этапов реализации, используя не более 220 слов. На каждом этапе необходимо указать тип сбоя, изменение на уровне кода и одну проверку корректности. Сохраните условия внешнего API. Не пишите полный код.
Claude Opus 5
162 входа · 656 выходов · 818 всего · 11,7 с локального сквозного времени
Фактический результат: Четкий и лаконичный план, охватывающий потоковую обработку, классификацию повторных попыток, идемпотентность, контрольные точки и обработку «мертвых» сообщений.

Прочитайте полный исходный вывод
1. **Исчерпание памяти при загрузке всего файла** — Замените `json.load()` на потоковый парсер (`ijson.items(f, 'records.item')`), возвращающий по одной записи за раз; выполняйте преобразование отложенно с помощью генераторов, никогда не материализуя список. *Проверка:* запустите обработку полного файла с ограничением RSS (`resource.setrlimit`) на ~500 МБ; процесс должен завершиться. 2. **Неограниченные накладные расходы на каждую запись** — Перед отправкой сгруппируйте записи в блоки фиксированного размера (например, 500), сохраняя тело запроса на каждый вызов идентичным текущему соглашению. *Проверка:* сравните сериализованные полезные нагрузки по старым и новым путям для выборки из 1 000 записей; требуется байтовое равенство. 3. **Шквал повторных попыток при временных сбоях** — Оберните вызовы API в механизм экспоненциального отката с джиттером и ограничением максимального количества попыток; повторяйте попытки только при ошибках 5xx, 429 и ошибках соединения/таймаута, никогда — при ошибках 4xx. *Проверка:* заглушка с имитацией сбоев, возвращающая три раза код 503, а затем 200; убедитесь, что временные метки попыток растут геометрически, а код 400 немедленно прерывает процесс. 4. **Дублирование записей после таймаута** — Сгенерируйте детерминированный ключ идемпотентности для каждой записи (хэш стабильных бизнес-полей) и отправьте его в существующем заголовке/поле, которое API уже принимает. *Проверка:* вызовите таймаут после фиксации на стороне сервера, воспроизведите операцию и убедитесь, что сохранен одна строка. 5. **Отсутствие восстановления после сбоя** — Сохраните последний зафиксированный смещение/идентификатор записи в файл контрольной точки, который синхронизируется с файловой системой только после того, как API подтвердит пакет. *Проверка:* запустите SIGKILL в середине выполнения, перезапустите, убедитесь в отсутствии пробелов и повторно обработанных фиксаций. 6. **Незаметные частичные сбои** — перенаправление записей, для которых исчерпано количество попыток повтора, в файл «dead-letter» с контекстом ошибки; выход с ненулевым кодом, если файл не пуст. *Проверка:* вставка постоянных кодов ошибок 400; подтверждение совпадения подсчётов.
GPT-5.6 Sol
106 входящих · 695 исходящих · 801 всего · 16,4 с локальное время от начала до конца
Фактический результат: Более полный план разработки, в частности в отношении ограниченных очередей, отпечатков входных данных, атомарных контрольных точек и точек сбоя.

Прочитайте полный исходный вывод
1. **Исчерпание памяти:** Замените `json.load()` на инкрементный синтаксический анализ (`ijson` для массивов или итерацию по строкам для NDJSON), обеспечивающий получение одной записи за раз. **Проверка:** Обработайте тестовый набор объёмом в несколько ГБ, следя за тем, чтобы объем памяти, занимаемой в оперативной памяти, не превышал заданного предела. 2. **Неограниченный объём текущей работы:** Свяжите рабочие процессы разбора, преобразования и API с помощью ограниченных очередей с настраиваемой степенью параллелизма и обратным давлением. **Проверка:** Ограничьте пропускную способность API и убедитесь, что глубина очереди остаётся в заданных пределах, а разбор приостанавливается. 3. **Шквал повторных попыток и циклы постоянных сбоев:** классифицируйте ошибки, допускающие повторные попытки (таймауты, 429, отдельные коды 5xx), применяйте ограниченный экспоненциальный откат с джиттером, соблюдайте параметр `Retry-After` и отправляйте в корзину «dead-letter» записи, не подлежащие повторной попытке или исчерпавшие лимит попыток. **Проверка:** Введите смешанные коды статуса и подтвердите количество повторных попыток, задержки и маршрутизацию «мертвых писем». 4. **Дублирование записей после неоднозначных таймаутов:** Выведите стабильный ключ идемпотентности из идентификатора исходной записи и отправьте его через существующий механизм идемпотентности API без изменения конечной точки или полезной нагрузки. Обеспечьте долгосрочное сохранение состояния ключа/результата. **Проверка:** Вызовите таймаут после фиксации на сервере и убедитесь, что выполнена только одна удаленная запись. 5. **Отсутствие восстановления после сбоя:** Сохраняйте атомарные контрольные точки, содержащие идентификатор файла, смещение/индекс записи и состояние обработки; возобновляйте обработку только при совпадении входного отпечатка. **Проверка:** Прерывайте работу службы в случайных моментах и убедитесь, что при перезапуске обработка возобновляется без повторного чтения зафиксированных записей. 6. **Преждевременный переход к следующему контрольному пункту:** помечать запись как завершённую только после устойчивого успеха или сохранения в «папке мёртвых писем», затем переходить к следующим контрольным пунктам по соседним завершённым записям. **Проверка:** вызвать сбой между успешным выполнением API-вызова, сохранением состояния и обновлением контрольного пункта; убедиться, что при восстановлении не теряются записи и не дублируются записи.
Из этого следует: Оба подхода позволили разработать применимые шестиэтапные планы. Подход GPT-5.6 Sol более четко учитывал обратное давление, механизм Retry-After, состояние атомарной контрольной точки и преждевременный переход к следующей контрольной точке. Подход Claude работал быстрее и использовал в целом чуть меньше токенов, однако предлагаемое им группирование запросов могло потребовать более тщательного подхода для сохранения существующего контракта запроса.
Написание и редактирование
Тот же полный запрос на английском языке, тот же маршрут API, совместимый с Broly OpenAI, температура 0,2, один вызов на модель и отсутствие повторных попыток.
Посмотреть точную формулировку задания
Перепишите приведенный ниже черновик, сформулировав его естественным американским английским языком объемом 160–180 слов. Точно сохраните следующие пять фактов: (1) GlobalGPT предоставляет доступ к нескольким моделям ИИ в рамках одной подписки; (2) Claude Opus 5 доступен на платформе GlobalGPT; (3) GPT-5.6 Sol доступен на GlobalGPT; (4) пользователи могут сравнивать эти две модели с помощью одного и того же запроса; (5) результаты могут варьироваться в зависимости от задачи. Используйте один короткий подзаголовок. Удалите повторения. Не используйте выражения “в современном цифровом мире”, “раскрыть потенциал” или “революционное решение”. Сохраняйте прямой, полезный и слегка коммерческий тон. Отправляйте только отредактированный текст. Черновик: Выбор модели ИИ затруднен, поскольку описания моделей часто звучат одинаково, а результаты тестов не всегда отражают реальную работу в повседневных условиях. GlobalGPT предоставляет доступ к нескольким моделям ИИ в рамках одной подписки, что означает, что пользователям не нужно создавать отдельные учетные записи у каждого поставщика. Модель Claude Opus 5 доступна на платформе GlobalGPT. Модель GPT-5.6 Sol доступна на платформе GlobalGPT. Обе модели могут помочь в программировании, написании текстов, анализе и исследованиях, хотя оптимальный выбор может зависеть от конкретной задачи. Пользователи могут сравнить обе модели, используя один и тот же запрос. Это позволяет легче оценить фактический ответ, а не полагаться исключительно на маркетинговые заявления. Результаты могут варьироваться в зависимости от задачи. Модель, генерирующая изящную прозу, может не быть той моделью, которая наиболее надежно следует строгому формату JSON. Модель, быстро решающая задачу по программированию, может использовать больше токенов при составлении длинного обзора исследований. Практичный подход заключается в комплексном сравнении качества результатов, трудоемкости исправлений, скорости и удобства использования. GlobalGPT делает такой параллельный рабочий процесс менее утомительным, поскольку обе модели доступны в одном месте. Тем не менее, перед тем как выбрать модель по умолчанию для своей команды, вам следует протестировать типичные запросы из вашей собственной работы.
Claude Opus 5
578 входных · 1 893 выходных · 2 471 всего · 20,9 с локальное время от начала до конца
Фактический результат: Естественное начало, плавные переходы, прямой коммерческий тон, не требующий существенной доработки.

Прочитайте полный исходный вывод
Выбор модели ИИ оказывается сложнее, чем должно быть. Описания на страницах продуктов, как правило, очень похожи, а результаты тестов редко дают представление о том, как модель ведет себя в обычных рабочих условиях. GlobalGPT предоставляет доступ к нескольким моделям ИИ в рамках одной подписки, поэтому вам не нужно создавать отдельную учетную запись у каждого поставщика. На GlobalGPT доступны как Claude Opus 5, так и GPT-5.6 Sol. Обе модели хорошо справляются с программированием, написанием текстов, анализом и исследованиями, хотя оптимальный выбор зависит от того, чем вы занимаетесь. **Проведите тестирование с собственными запросами** Пользователи могут сравнить две модели с помощью одного и того же запроса, что позволяет оценить реальный результат, а не маркетинговые обещания. Результаты могут варьироваться в зависимости от задачи. Модель, которая пишет изящную прозу, может не быть той, которая надежно следует строгой схеме JSON, а модель, которая быстро решает задачи по программированию, может тратить больше токенов на длинный обзор результатов исследования. Сравнивайте качество результатов, трудоемкость доработки, скорость и удобство использования. Поскольку обе модели находятся в одном месте, их параллельное тестирование не займет много времени — просто запустите несколько запросов из вашей реальной работы, прежде чем выбрать модель по умолчанию.
GPT-5.6 Sol
375 входных · 1 028 выходных · 1 403 всего · 17,8 с локальное время от начала до конца
Фактический результат: Текст изложен ясно и готов к публикации, в нем точно отражены факты, однако формулировки более традиционные, а подзаголовок — более формальный.

Прочитайте полный исходный вывод
Описания моделей и результаты тестов могут выглядеть убедительно, но они не всегда отражают, как ИИ будет работать в повседневной практике. GlobalGPT предоставляет доступ к нескольким моделям ИИ в рамках одной подписки, что избавляет от необходимости управлять отдельными учетными записями у разных поставщиков. Модель Claude Opus 5 доступна на платформе GlobalGPT, а модель GPT-5.6 Sol — на платформе GlobalGPT. ### Сравнение реальных результатов Пользователи могут сравнить две модели с одним и тем же запросом, что позволяет легче оценить их ответы напрямую, а не полагаться на общие маркетинговые заявления. Результаты могут варьироваться в зависимости от задачи. Одна модель может генерировать более отточенный текст, в то время как другая может более последовательно придерживаться строгого формата JSON. Быстрый ответ при написании кода также может отличаться от оптимального выбора для подробного обобщения результатов исследования. При оценке каждой модели учитывайте качество результатов, скорость, использование токенов и усилия, необходимые для исправления или доработки ответа. GlobalGPT объединяет этот рабочий процесс с параллельным сравнением в одном месте. Прежде чем выбрать модель по умолчанию для себя или своей команды, протестируйте типичные запросы из вашей реальной работы и сравните результаты с наиболее важными для вас критериями.
Из этого следует: Оба текста уложились в пределы 160–180 слов, сохранили все пять фактов, использовали один подзаголовок и избегали запрещенных фраз. Вступление и переходы в тексте Claude звучали более естественно и менее шаблонно. Текст GPT был лаконичным и готовым к публикации, но немного более формальным.
Логическое мышление и анализ данных
Тот же полный запрос на английском языке, тот же маршрут API, совместимый с Broly OpenAI, температура 0,2, один вызов на модель и отсутствие повторных попыток.
Посмотреть точную формулировку задания
Проанализируйте приведенную ниже таблицу. Рассчитайте коэффициент конверсии по покупкам (количество покупок / количество посетителей), коэффициент возвратов (количество возвратов / количество покупок) и выручку на одного посетителя за каждую неделю. Определите один показатель, который с наибольшей вероятностью может ввести в заблуждение лицо, принимающее решения. Отделите подтвержденные факты от предположений. Рекомендуйте ровно два действия, каждое из которых должно быть связано с одним из рассчитанных показателей. Приведите краткие расчёты и не добавляйте внешние контрольные показатели. Неделя | Посетители | Начало оформления заказа | Покупки | Возвраты | Выручка 1 | 1 000 | 180 | 120 | 6 | $3 240 2 | 1 100 | 210 | 110 | 5 | $6 600 3 | 950 | 190 | 130 | 4 | $3 510 Важное примечание к источнику: в выручке за 2-ю неделю случайно включена сумма $3 600 из годового счёта для предприятия, который не был сформирован этими посетителями.
Claude Opus 5
286 входных · 2 233 выходных · 2 519 всего · 28,2 с локальное время от начала до конца
Фактический результат: Правильное и содержательное с аналитической точки зрения, но значительно более объемное, чем необходимо, и в большей степени опирающееся на дополнительные допущения.

Прочитайте полный исходный вывод
## Расчеты | Неделя | Посетители | Покупки | Коэффициент конверсии | Возвраты | Коэффициент возвратов | Выручка | RPV | |---|---|---|---|---|---|---|---| | 1 | 1 000 | 120 | 120/1 000 = **12,0%** | 6 | 6/120 = **5,0%** | $3 240 | **$3,24** | | 2 | 1 100 | 110 | 110/1 100 = **10,01 TP40T** | 5 | 5/110 = **4,51 TP40T** | $6 600 | **$6,00** (указано в отчёте) | | 2 скорректировано | 1 100 | 110 | 10,01 TP40T | 5 | 4,51 TP40T | 1 TP41T 6 600 − 1 TP41T 3 600 = 1 TP41T 3 000 | **$2,73** | | 3 | 950 | 130 | 130/950 = **13,7%** | 4 | 4/130 = **3,1%** | $3 510 | **$3,69** | Вспомогательные коэффициенты (из приведённых столбцов): - Переход к оформлению заказа → покупка: W1 120/180 = 66,7% · W2 110/210 = 52,4% · W3 130/190 = 68,4% - Посетитель → оформление заказа: W1 18,0% · W2 19,1% · W3 21,1% (190/950 — наибольшее из трёх) - Расчётная средняя сумма корзины (AOV): W1 $3 240/120 = $27,00 · W2 (скорректированная) $3 000/110 = $27,27 · W3 $3 510/130 = $27,00 ## Наиболее вводящее в заблуждение исходное значение **Выручка за 2-ю неделю: $6 600.** Если принимать это значение за чистую монету, получается показатель RPV равный $6,00 — примерно вдвое больше, чем в любую другую неделю, — и это могло бы навести на мысль, что 2-я неделя была лучшей. После исключения счета предприятия на сумму $3,600 вторая неделя становится *худшей* по показателю RPV ($2,73) и худшей по конверсии (10,0%). Вывод полностью меняется на противоположный. ## Проверенные факты (из таблицы + примечания к источнику) - Третья неделя имеет самый высокий коэффициент конверсии (13,71 TP40T), самый высокий показатель RPV (1 TP41T 3,69) и самый низкий показатель возвратов (3,11 TP40T). - На 2-й неделе отмечается наибольшее количество начатых оформлений заказов в абсолютных цифрах (210), но наименьшее количество покупок (110). - Коэффициент 'оформление заказа → покупка' (52,4%) на 2-й неделе примерно на 14 пунктов ниже, чем на 1-й и 3-й неделях. - $3,600 выручки второй недели не приходится на долю этих посетителей. - Скорректированный средний чек (AOV) остается стабильным на уровне ~$27 в течение всех трёх недель. ## Допущения (не подтверждённые данными) - $3,600 является *единственной* записью, искажающей данные; остальные недели считаются 'чистыми'. - Возвраты относятся к неделе покупки, а не к неделе оформления возврата; если возврат происходит с задержкой, показатели возвратов за последние недели занижаются. - Посетители подсчитываются последовательно от недели к неделе, и их состав трафика сопоставим. - Спад конверсии на второй неделе отражает проблему воронки продаж, а не изменение в отслеживании или составе трафика. - Три недели рассматриваются как тренд; при таких показателях еженедельные колебания могут быть случайными отклонениями. ## Рекомендуемые действия **1. Провести аудит процесса оформления заказов на второй неделе с ориентацией на коэффициент «оформление заказа → покупка» 52,4%.** Применение показателя завершенности ~67%, наблюдавшегося на первой и третьей неделях, к 210 начатым оформлениям заказов на второй неделе предполагает ~141 покупку; фактическое значение 110 означает недополучение ~31 заказа, или ~31 × $27 ≈ **$840 в виде упущенной выручки за эту неделю**. Проанализируйте ошибки при оплате, сбои при использовании промокодов, а также отображение стоимости доставки и налогов за этот период. **2. Пересчитайте базовые показатели отчёта по скорректированному RPV и повторите расчёты для 3-й недели, ориентируясь на RPV $3,69 по сравнению с $2,73.** Пересчитайте показатели 2-й недели с учетом $3,000 и в дальнейшем выделяйте выручку от не-посетителей в отдельную строку. Затем определите, что изменилось в 3-й неделе — её коэффициент перехода посетителей к оформлению заказа (21,11 TP40T) и коэффициент конверсии (13,71 TP40T) принесли на 1 TP41T0,96 больше на одного посетителя, чем скорректированные показатели 2-й недели, что составляет ~$1,050 при применении к 1,100 посетителям недели 2.
GPT-5.6 Sol
182 входных · 791 выходных · 973 всего · 15,1 с локальное время от начала до конца
Фактический результат: Точные, лаконичные, поддающиеся отслеживанию и готовые к непосредственному использованию в документе с обоснованием решения с минимальной доработкой.

Прочитайте полный исходный вывод
## Проверенные факты и расчёты | Неделя | Коэффициент конверсии по покупкам | Коэффициент возврата | Выручка на одного посетителя | |---|---:|---:|---:| | 1 | 120 / 1 000 = **12,00%** | 6 / 120 = **5,00%** | $3 240 / 1 000 = **$3,24** | | 2, заявленное | 110 / 1 100 = **10,00%** | 5 / 110 = **4,55%** | $6 600 / 1 100 = **$6,00** | | 2, исправленное | **10,00%** | **4,55%** | ($6 600 − $3 600) / 1 100 = **$2,73** | | 3 | 130 / 950 = **13,68%** | 4 / 130 = **3,08%** | $3 510 / 950 = **$3,69** | **Наиболее вводящее в заблуждение значение источника:** выручка за 2-ю неделю в размере **$6 600**. Оно включает счёт на сумму **$3 600**, не связанный с этими посетителями, что завышает выручку, приписанную посетителям, на 120%, а показатель RPV — с **$2,73 до $6,00**. ## Допущения - Исправленная выручка, приписанная посетителям за 2-ю неделю, составляет **$3,000**, при условии, что остальная выручка принадлежит этим посетителям. - Выручка рассматривается как отчётная валовая выручка; суммы возмещений не вычитаются, поскольку данные о суммах возмещений в долларах не предоставлены. ## Рекомендуемые действия 1. **Исправьте отчётность за 2-ю неделю**, исключив не относящийся к делу счёт на сумму $3,600, и используйте показатель **$2.73 RPV**, а не $6.00, для принятия решений по привлечению посетителей. 2. **Проанализируйте и воспроизведите условия воронки продаж за 3-ю неделю**, поскольку именно она обеспечила самый высокий коэффициент конверсии по покупкам (**13,68%**) и самый низкий показатель возвратов (**3,08%**).
Из этого следует: Оба участника правильно рассчитали необходимые показатели и выявили искажённые данные по выручке за 2-ю неделю. Участник GPT-5.6 Sol ответил на вопрос о принятии решения, использовав гораздо меньше лишнего материала, и чётко соблюдал ограничение «ровно два действия». Участник Claude добавил полезные расчёты по воронке продаж, однако его результат потребовал более тщательной редакционной доработки и содержал смоделированную оценку упущенной выручки.
Исследование и обобщение источников
Тот же полный запрос на английском языке, тот же маршрут API, совместимый с Broly OpenAI, температура 0,2, один вызов на модель и отсутствие повторных попыток.
Посмотреть точную формулировку задания
Прочитайте Источник А и Источник В. Приведите ровно шесть выводов. Для каждого вывода укажите название источника и номер абзаца. Выявите один существенный противоречивый момент между источниками и объясните, почему он важен, не более чем в 60 словах. Не используйте информацию из Интернета и не добавляйте факты, которых нет в источниках. В заключение составьте контрольный список из трёх пунктов для проверки. Источник A [A1] Трехнедельное тестирование процесса оформления заказа охватило 12 000 посещений с настольных компьютеров. Исходная страница привела к 1 920 начатым оформлениям заказа и 1 056 завершённым покупкам. [A2] В варианте информация о цене была перенесена выше формы оплаты. Он привёл к 2 040 начатым оформлениям заказов и 1 224 завершённым покупкам из 12 100 посещений. [A3] Количество обращений в службу поддержки, в которых упоминалась неожиданная цена, сократилось с 84 до 39. Тест не включал мобильный трафик. Источник B [B1] Более позднее двухнедельное тестирование охватило 8 400 посещений, из которых 72% пришлось на мобильные устройства. В ходе теста сравнивались исходная страница и вариант, в котором были объединены более раннее раскрытие цены, сокращённый текст формы и значок доверия. [B2] Вариант с комбинацией этих элементов увеличил количество завершенных покупок с 52% до 58%, однако в отчете не было отдельно указано влияние каждого из этих трех изменений. [B3] Количество обращений в службу поддержки, в которых упоминалась неожиданная цена, осталось неизменным — по 31 в каждой группе. Аналитик предупредил, что тест не обладал достаточной статистической мощностью для выявления различий в количестве обращений в службу поддержки.
Claude Opus 5
427 входных · 1 199 выходных · 1 626 всего · 17,2 с локальное время от начала до конца
Фактический результат: Более глубокий анализ, более эффективное урегулирование противоречий и контрольный список для проверки, который поможет оптимизировать следующий этап исследования.

Прочитайте полный исходный вывод
**Результаты** 1. **Масштаб тестирования на настольных компьютерах и исходные показатели (Источник A, [A1]):** За три недели 12 000 посещений оригинальной страницы с настольных компьютеров привели к 1 920 начатым оформлениям заказов и 1 056 завершенным покупкам — коэффициент завершения среди тех, кто начал оформление заказа, составил 55%. 2. **Влияние варианта на коэффициент завершения (Источник A, [A2]):** Вариант, в котором информация о цене была перенесена выше формы оплаты, привёл к 2 040 начатым оформлениям заказа и 1 224 покупкам из 12 100 посещений — коэффициент завершения от начала оформления до покупки составил 60% по сравнению с 55% для исходного варианта. 3. **Изолированное изменение, ограниченная выборка (Источник A, [A2], [A3]):** В источнике A тестировалось одно изменение (расположение информации о цене), поэтому его результат можно отнести исключительно к этому изменению; однако из анализа был полностью исключен мобильный трафик. 4. **Комплексный дизайн ограничивает атрибуцию (Источник B, [B1], [B2]):** В ходе последующего двухнедельного теста были объединены три изменения — более раннее раскрытие информации о ценах, сокращение текста формы и значок доверия — и было отмечено увеличение показателя завершения с 52% до 58%, однако в отчете эти три эффекта не были разделены. 5. **Различный состав трафика (Источник B, [B1]):** Второй тест охватил 8 400 посещений, из которых 72% пришлось на мобильные устройства, поэтому он измерял существенно иную выборку, чем тест, проводившийся только на настольных компьютерах в Источнике A. 6. **Сигнал и статистическая мощность по заявкам в службу поддержки (Источник B, [B3]):** Количество заявок, связанных с неожиданной ценой, было одинаковым — по 31 в каждой группе, и аналитик предупредил, что тест не обладал достаточной статистической мощностью для выявления различий в количестве таких заявок. **Существенный конфликт (≤60 слов)** Источник A сообщает, что количество заявок, связанных с неожиданной ценой, снизилось с 84 до 39 при более раннем раскрытии информации о ценах ([A3]); источник B сообщает об отсутствии изменений — 31 против 31 — при использовании варианта, включавшего такое же раскрытие информации ([B3]). Это имеет значение, поскольку сокращение количества обращений является основным обоснованием затрат на поддержку, и оно может не подтвердиться в мобильном сегменте — хотя источник B признает, что его исследование не обладало достаточной статистической мощностью. **Контрольный список для проверки** 1. Подтвердите показатели завершения: пересчитайте 1 056/1 920 и 1 224/2 040 из [A1]–[A2] и проверьте, использует ли источник B 52%/58% ([B2]) использует тот же знаменатель (начало оформления заказа) или общее количество посещений. 2. Получите разбивку по отдельным изменениям для комбинированного варианта источника B ([B1]–[B2]), чтобы определить, какая часть прироста в 6 пунктов была обусловлена раскрытием информации о ценах. 3. Запросите расчёт статистической мощности и базовые показатели объёма заказов, лежащие в основе [B3], чтобы установить, может ли соотношение 31 к 31 скрывать эффект такого масштаба, как в [A3].
GPT-5.6 Sol
279 входных · 631 выходных · 910 всего · 22,5 с локальное время от начала до конца
Фактический результат: Изложение было точным и лаконичным, однако итоговый контрольный список носил скорее процедурный характер, а не был ориентирован на доказательства.

Прочитайте полный исходный вывод
1. Трехнедельное тестирование источника A, проводившееся исключительно на настольных компьютерах, охватило 12 000 посещений исходной страницы и 12 100 посещений страницы с вариантами. (Источник A, A1–A3) 2. В источнике A исходная версия привела к 1 920 началам оформления заказа и 1 056 покупкам, тогда как вариант с ранним раскрытием цен привёл к 2 040 началам оформления заказа и 1 224 покупкам. (Источник A, A1–A2) 3. Вариант из источника A имел более высокий коэффициент «посещение/покупка»: примерно 10,1% по сравнению с 8,8% у оригинальной версии. (Источник A, A1–A2) 4. Двухнедельное тестирование источника B охватило 8 400 посещений, 721 TP40T с мобильных устройств и включало тестирование трех комбинированных изменений: более раннее раскрытие цен, сокращение текста формы и значок доверия. (Источник B, B1) 5. Источник B сообщил о росте количества завершенных покупок с 52% до 58%, однако комплексный характер изменений не позволил определить, какое именно изменение повлияло на этот результат. (Источник B, B2) 6. **Существенное несоответствие:** Источник A сообщил о снижении количества обращений по поводу неожиданных цен с 84 до 39, тогда как источник B зафиксировал по 31 обращению в каждой группе. Это имеет значение, поскольку несогласованность результатов — а также предупреждение источника B о недостаточной статистической мощности — снижает уверенность в том, что более раннее раскрытие цен приводит к сокращению количества обращений в службу поддержки. (Источник A, A3; Источник B, B3) Контрольный список для проверки: - [ ] Приведено ровно шесть выводов. - [ ] Каждый вывод сопровождается указанием источника и абзаца. - [ ] Не добавлено никакой информации, помимо данных из источников A и B.
Из этого следует: Оба алгоритма выдали по шесть цитируемых выводов без приведения внешних фактов. Claude представил более убедительный анализ: он отделил противоречие от шести выводов, рассчитал соответствующие показатели завершенности, выявил проблему с объединенными переменными и завершил работу разработкой содержательного плана проверки. Контрольный список GPT в основном проверял собственное форматирование, а не лежащие в основе доказательства.
| Редакционный критерий | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|
| Результат кодирования | 4.3 | 4.8 |
| Запись результатов | 4.8 | 4.5 |
| Результаты анализа данных | 4.0 | 4.8 |
| Синтез исследований | 4.8 | 4.1 |
| Эффективность реагирования | 3.2 | 4.7 |
Ничья более полезна, чем вынужденное определение единого победителя. Команда GPT-5.6 Sol представила более надежный инженерный план и более четкий анализ, готовый к принятию решения. Команда Claude Opus 5 представила более естественный отредактированный текст и более убедительный синтез доказательств. В рамках данного набора заданий модель Claude сгенерировала 5 981 токен результата по сравнению с 3 145 у модели GPT-5.6 Sol, однако эти цифры не являются показателем качества; в основном они показывают, что модель Claude давала более развернутые ответы на эти запросы.
Часто задаваемые вопросы
Модель Claude Opus 5 лучше, чем GPT-5.6?
Ни одна из моделей не заняла первое место во всех категориях нашего набора задач Broly API, состоящего из четырёх задач. Модель GPT-5.6 Sol показала лучшие результаты в категориях «программирование» и «анализ данных», а модель Claude Opus 5 — в категориях «написание текста» и «синтез исходного кода». Выбор более подходящей модели зависит от того, какой результат требует меньшего объёма корректировки в рамках вашего конкретного рабочего процесса.
Что лучше для программирования: Claude Opus 5 или GPT-5.6?
Модель GPT-5.6 Sol с небольшим отрывом победила в нашем тесте по программированию API Broly. Обе модели охватили такие аспекты, как потоковая обработка, управление повторными попытками, идемпотентность, контрольные точки и обработка «мертвых» сообщений. GPT добавил более чёткие механизмы защиты: обратное давление, отпечаток входных данных, атомарные контрольные точки и восстановление после сбоя. Модель Claude работала быстрее в этом вызове и использовала чуть меньше токенов в целом, но план GPT потребовал меньше технических исправлений.
Какая модель лучше подходит для письма?
Вариант Claude Opus 5 с небольшим перевесом победил в нашем тесте по письменной работе. В обоих ответах были сохранены все пять требуемых фактов, избегались три запрещенных клише, использовался один подзаголовок и соблюдалось ограничение в 160–180 слов. Переработанный вариант Claude объемом 165 слов звучал чуть более естественно и требовал меньшего объема редакторских исправлений.
Какая модель лучше подходит для научных исследований и работы с объемными документами?
Модель Claude Opus 5 победила в нашем задании по контролируемому синтезу на основе двух источников, поскольку она добавила более полезный анализ по методу «воронки», привела ссылки на каждый вывод, выделила смешивающую переменную и уложилась в требуемый объем объяснения противоречий — 58 слов. Модель GPT была более лаконичной и также правильно выполнила требуемую структуру.
В какой модели лучше реализована поддержка агентов и инструментов?
В версии GPT-5.6 Sol представлен более обширный, явно задокументированный список инструментов, поддерживаемых API Responses. Версия Claude Opus 5 ориентирована на долго работающие агенты и сложную оркестрацию нескольких инструментов. Выбор оптимального варианта зависит от того, нужен ли вам конкретный хостируемый инструмент или более расширенные возможности в рамках вашей собственной среды инструментов.
Модель Claude Opus 5 дешевле, чем GPT-5.6 Sol?
При стандартных тарифах прямого API обе операции стоят $5 за миллион входных токенов. Claude Opus 5 стоит $25 за миллион выходных токенов, а GPT-5.6 Sol — $30. Общая сумма может изменяться в зависимости от пакетной обработки, уровней скорости, множителей длинного контекста и сборов за использование инструментов.
Обозначение «GPT-5.6» означает «GPT-5.6 Sol»?
В API gpt-5.6 Псевдоним «routes to GPT-5.6 Sol». GPT-5.6 также является общим названием для моделей Sol, Terra и Luna, поэтому в любых заявлениях о цене или тестовых результатах следует указывать конкретную модель из этой линейки.
Можно ли использовать Claude Opus 5 и GPT-5.6 в одном месте?
Да. 27 июля 2026 года на сайте GLBGPT были доступны страницы с актуальными данными о продуктах как для модели Claude Opus 5, так и для модели GPT-5.6 Sol. Это позволяет запускать один и тот же запрос для обеих моделей без необходимости предварительного открытия отдельных учетных записей у поставщиков.
Окончательный вердикт
Реальные тесты API завершились со счётом 2:2, поэтому практический выбор зависит от того, какой результат вам нужен. Работа GPT-5.6 Sol получила высокую оценку в номинации «Программирование и анализ данных» благодаря разработке более полных мер операционной безопасности и более лаконичных расчетов, готовых к принятию решений. Работа Claude Opus 5 получила высокую оценку в номинации «Написание текста и обобщение результатов исследований» благодаря более естественному стилю изложения и более тщательному плану проверки доказательств.
Выбирайте вариант GPT-5.6 Sol, когда наибольшее значение имеют четкая структура, лаконичный анализ и техническое освещение, ориентированное на практическое применение. Выбирайте Claude Opus 5, когда качество изложения, глубина обобщения и редакционная оценка оправдывают более развернутый ответ. Общее количество токенов и затраченное время являются полезными показателями стоимости, но окончательное решение должно приниматься с учетом фактического результата работы и объема корректировки.
Обе точные модели доступны на GLBGPT, так что вы сможете запускать свой собственный репрезентативный запрос для каждой из них, не поддерживая при этом две отдельные подписки на модели.




