В этой статье:

• Что представила Anthropic: Claude Opus 5.5

• Что представила OpenAI: GPT-6 Sol и GPT-6 Luna

• Как с задачей справилась Claude Opus 5.5

Бриф статьи
Anthropic и OpenAI выпустили новые модели в один день. Мы сравнили Claude Opus 5.5 и GPT-6 Sol по цене, бенчмаркам и на одной реальной задаче… Результаты оказались интереснее, чем обещают релизы.

22 сентября 2026 года Anthropic и OpenAI с разницей в несколько часов представили новые модели. Anthropic выпустила Claude Opus 5.5 ― первую модель семейства Claude 5.5.

Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.

It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5. pic.twitter.com/Q9C2VKQ79f

— Claude (@claudeai) September 22, 2026

OpenAI ответила релизом GPT-6 Sol и GPT-6 Luna ― второй и третьей моделей линейки GPT-6 после вышедшей в начале месяца GPT-6 Astra.

Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe.

GPT-6 Sol and Luna build on the advances behind GPT-6 Astra, bringing much of its strengths into faster and more affordable models to support work at scale.

We’ve also made caching and inference more efficient, and… pic.twitter.com/5LiVE4rbFt

— OpenAI (@OpenAI) September 22, 2026

Оба анонса построены вокруг одной идеи ― уровень флагмана за меньшие деньги. По данным Anthropic, Opus 5.5 справляется с большинством задач на уровне Claude Fable 5.1, но обходится на 40% дешевле Opus 5. OpenAI заявляет, что GPT-6 Sol стоит вдвое меньше GPT-5.6 Sol и в ряде тестов догоняет модели Anthropic при затратах на 80% ниже.

Сравнить модели по официальным материалам не выходит. Компании публикуют результаты на разных бенчмарках, разных версиях одних и тех же тестов и при разных уровнях усилий. Поэтому модели нужно столкнуть на одной задаче.

Для этого подойдет procedural-film ― открытый скилл для ИИ-агентов, который превращает тему в 30-секундный вертикальный анимационный фильм. Каждый пиксель в нем рисует код на JavaScript, а каждый звук синтезирует Web Audio. Задача длинная и многоэтапная: исследование, раскадровка, параллельная работа субагентов над сценами, музыка, критика и рендер. Именно такие сценарии обе компании называют главной сильной стороной новых моделей.

Редакция Incrypted разобралась, что нового в Claude Opus 5.5 и GPT-6 Sol, а затем дала обеим моделям одинаковое задание ― снять через procedural-film 15-секундный фильм об истории Incrypted.

  • 22 сентября 2026 года Anthropic выпустила Claude Opus 5.5, а OpenAI ― GPT-6 Sol и GPT-6 Luna.
  • Opus 5.5 стоит $4 за млн входных и $20 за млн выходных токенов. По заявлению Anthropic, модель работает на уровне Fable 5.1, генерирует текст на 30% быстрее Opus 5 и лучше делегирует задачи субагентам.
  • GPT-6 Sol стоит $2 и $10, GPT-6 Luna ― $0,10 и $0,50. Обе модели доступны в Codex и ChatGPT Work на платных тарифах, а Luna ― еще и бесплатным пользователям в десктопном приложении.
  • В бенчмарках Anthropic Opus 5.5 опережает GPT-6 Astra в агентном программировании: 66,4% против 57,9% на Terminal-Bench 4.0. OpenAI сравнивает GPT-6 Sol с прошлыми моделями Anthropic и делает упор на цену задачи.
  • procedural-film ― бесплатный скилл под лицензией MIT. Он работает в Claude Code, Codex и других агентах с поддержкой скиллов и субагентов. 
  • В тесте обе модели сняли фильм об истории Incrypted. Opus 5.5 работала 35 минут, задействовала 13 субагентов и прошла полный цикл критики. GPT-6 Sol обошлась десятью субагентами и компактным кодом, а все цифры в кадре взяла со страницы About.

Что представила Anthropic: Claude Opus 5.5 

Opus 5.5 открывает семейство Claude 5.5. Anthropic уже пообещала выпустить Sonnet 5.5 и Haiku 5.5, но без конкретных дат. Главный аргумент релиза ― соотношение цены и возможностей. Opus 5.5 стоит в 2,5 раза дешевле Claude Fable 5.1, а по большинству тестов не уступает ему.

Основные характеристики модели приведены в документации Anthropic:

  • идентификатор в API ― claude-opus-5-5;
  • контекстное окно ― 1 млн токенов, максимальный вывод ― 128 000 токенов;
  • знания модели ограничены июнем 2026 года;
  • цена ― $4 за млн входных и $20 за млн выходных токенов, чтение из кеша ― $0,20;
  • быстрый режим (fast mode) стоит вдвое дороже ― $8 и $40;
  • пять уровней усилий, от low до max, по умолчанию ― medium. Режим рассуждений нельзя отключить.

Opus 5.5 доступна на тарифах Pro, Max, Team и Enterprise, в API, а также в Amazon Web Services, Google Cloud и Microsoft Azure. Вместе с релизом Anthropic подняла пятичасовые лимиты на платных тарифах. Подписчики также получили разовый сброс лимитов, который можно сохранить и использовать в любой момент.

По словам Anthropic, Opus 5.5 «гораздо эффективнее делегирует работу субагентам и проверяет собственную работу». Кроме того, модель генерирует текст более чем на 30% быстрее Opus 5.

Anthropic отдельно отмечает прогресс в безопасности. По данным компании, Opus 5.5 пытается обойти установленные ограничения на 85% реже, чем Opus 5, и лучше сопротивляется атакам через внедрение промптов (prompt injection). До релиза модель проверили внешние организации, включая METR.

Opus 5.5 в бенчмарках

Anthropic сравнила Opus 5.5 не только со своими моделями, но и с GPT-6 Astra и GPT-5.6 Sol. GPT-6 Sol в таблицу не попала: она вышла позже в тот же день. Результаты приведены по данным Anthropic. 

Результаты бенчмарков. Данные: Anthropic.

Opus 5.5 обходит Fable 5.1 во всех тестах из таблицы. GPT-6 Astra сохраняет преимущество в автоматизации бизнес-процессов и научных задачах. При этом Anthropic утверждает, что на сопоставимых задачах Opus 5.5 обходится в 20-40% стоимости GPT-6 Astra и GPT-5.6 Sol. 

Что представила OpenAI: GPT-6 Sol и GPT-6 Luna

OpenAI продолжает «именную» линейку GPT-6. Astra остается флагманом, Sol занимает место основной рабочей модели, а Luna ― компактной и дешевой. По словам OpenAI, обе новые модели тратят меньше токенов, чем предшественницы, а цены в API снижены вдвое.

Характеристики GPT-6 Sol приведены на странице модели:

  • идентификатор в API ― gpt-6-sol;
  • контекстное окно ― 1,05 млн токенов, максимальный вывод ― 128 000 токенов;
  • знания модели ограничены 20 апреля 2026 года;
  • цена ― $2 за млн входных и $10 за млн выходных токенов, кешированный ввод ― $0,20;
  • шесть уровней рассуждений: none, low, medium, high, xhigh и max.

GPT-6 Luna стоит $0,10 за млн входных и $0,50 за млн выходных токенов. По данным OpenAI, на высоком уровне рассуждений Luna достигает фактической точности GPT-5.6 Sol примерно за сотую часть цены.

Обе модели доступны в ChatGPT Work и Codex на тарифах Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go могут работать с GPT-6 Luna в десктопном приложении.

GPT-6 Sol в бенчмарках

OpenAI делает акцент не на рекордах, а на стоимости задачи. Почти каждый результат в анонсе сопровождается сравнением цены с моделями Anthropic. Приведем основные цифры из анонса.

AutomationBench 1.0.6. GPT-6 Sol на уровне xhigh набирает 33,2% при цене $0,27 за задачу. Claude Fable 5.1 с переключением на Opus 5 набирает 31,4% при стоимости в 8,9 раза выше.

DeepSWE v1.1. GPT-6 Sol на уровне max набирает 68,8% ― на 1,1 п.п. меньше лучшего результата Claude Fable 5 (69,9%), но примерно на 80% дешевле в расчете на задачу. GPT-6 Luna набирает 66,6%.

OSWorld 2.0 offline. GPT-6 Sol на уровне xhigh получает 60,5%, почти столько же, сколько Claude Opus 5 на уровне medium (60,3%), при затратах примерно на 80% ниже.

Фактическая точность. По данным OpenAI, GPT-6 Sol ошибается примерно вдвое реже GPT-5.6 Sol.

Вместе с моделями OpenAI обновила кеширование промптов. Разработчики получили панель мониторинга кеша, явные точки разрыва кеша и возможность менять уровень рассуждений без его сброса. По данным OpenAI, GitHub за несколько месяцев тестов сократил объем заново обрабатываемых токенов более чем на 50%.

Сравнить цифры двух анонсов напрямую нельзя. Anthropic и OpenAI используют разные версии AutomationBench и OSWorld, а GPT-6 Sol компания сравнивает с Opus 5 и Fable 5, а не с Opus 5.5. Поэтому дальше модели проверим на практике.

Что такое procedural-film 

procedural-film ― открытый скилл для ИИ-агентов, опубликованный 17 сентября 2026 года под лицензией MIT. Он превращает любую тему в короткий вертикальный фильм 1080×1920 с частотой 24 кадра в секунду. Фильм не использует ни одного медиафайла: изображение рисует JavaScript на canvas, а музыку и звуковые эффекты синтезирует Web Audio. Результат ― самостоятельная HTML-страница с плеером и MP4-файлы для публикации.

Визуальный стиль скилла повторяет ролик Кевина Нго «The life of a fruit fly». Кадры в стиле рисунка тушью на бумаге чередуются с темно-синими «чертежами», а каждая склейка приходится на сильную долю музыкального такта.

Claude Opus 5 drew every frame of this animation using JavaScript. The life of a fruit fly. pic.twitter.com/MysMJWGltz

— Kevin Ngo (@kevin_t_ngo) September 15, 2026

В репозитории лежит эталонный фильм о жизненном цикле бабочки-монарха: 17 кадров, 32 секунды, темп 120 ударов в минуту. На его код приходится около 35 000 строк сцен и еще почти 5000 строк движка, библиотеки рисования и музыки. Средняя сцена ― около 2000 строк JavaScript.

  1. Бриф ― агент задает один раунд вопросов о теме и длине фильма.
  2. Подготовка ― копирует движок, ставит Playwright и проверяет ffmpeg на тестовом мини-фильме.
  3. Исследование ― ищет в интернете 2-4 авторитетных источника на каждую фазу сюжета.
  4. Арт-библия ― фиксирует палитру и правила рисования каждого объекта, включая список типичных ошибок.
  5. Раскадровка и таймлайн ― расписывает кадры по сетке тактов с точностью до кадра.
  6. Заглушки ― собирает черновой ролик из пустых сцен, чтобы проверить весь конвейер.
  7. Сцены ― по одному субагенту на кадр, каждый пишет файл сцены и сам проверяет контакт-лист.
  8. Музыка ― партитура, в которой каждый звуковой акцент совпадает со склейкой с точностью до 10 мс.
  9. Волны критики ― субагенты-критики измеряют кадры в пикселях и отправляют сцены на доработку.
  10. Выдача ― рендер мастер-копии, версии для телефона, HTML-плеера и списка кадров.

Между этапами работает автоматическая проверка check.cjs из шести тестов. Она ищет запрещенные медиафайлы, проверяет детерминированность рендера, покрытие таймлайна и время отрисовки кадра. Пока проверка не пройдена, этап не считается завершенным.

Автор предупреждает, что прогон длинный и расходует «значительную часть лимита тарифа». Поэтому для теста мы сократили фильм вдвое ― до 15 секунд. Такой формат по-прежнему проверяет все этапы конвейера, включая параллельную работу субагентов.

Условия теста

Обе модели получили одинаковые условия. Claude Code работал с моделью claude-opus-5-5, Codex ― с gpt-6-sol. Уровень усилий в обоих случаях ― high, режим ― без подтверждения каждого действия.

Тему выбрали близкую редакции ― историю Incrypted. В отличие от эталонной бабочки, такой сюжет не описан в учебниках. Модели придется самой собрать факты, перерисовать настоящий логотип кодом и уложить историю в 15 секунд.

Промпт одинаковый для обеих моделей. Он сразу отвечает на вопросы брифа, чтобы агенты не останавливались.

Copy Use the procedural-film skill. Make a procedural film about the history of Incrypted, the Ukrainian crypto media (incrypted.com). Skip the brief questions, everything you need is here: - Story: how Incrypted grew from a small crypto community founded in 2017 into the largest crypto media in Ukraine: news in three languages, a YouTube channel, Incrypted Conference in Kyiv, the Academy and Incrypted Plus. - Length: about 15 seconds in whole bars, 7-8 shots. - Must include: the founding year 2017, the real Incrypted logo redrawn as vector code from the logo SVG in the header of https://incrypted.com/en/ (no image files), audience growth, the conference. - All on-screen text in English. - Take facts only from https://incrypted.com/en/about/ and sources you capture during research. Do not invent numbers. - Follow every step of SKILL.md, including one subagent per scene and the critic waves, until the gate is green. Deliver the master MP4, the phone MP4, the HTML player and shots.md. - At the end report the total run time, the number of subagents, line counts per scene file and any step you skipped.
Copy Используй скилл procedural-film. Сделай процедурный фильм об истории Incrypted, украинского криптомедиа (incrypted.com). Пропусти вопросы брифа, все необходимое здесь: - Сюжет: как Incrypted выросло из небольшого криптосообщества, основанного в 2017 году, в крупнейшее криптомедиа Украины: новости на трех языках, YouTube-канал, Incrypted Conference в Киеве, Академия и Incrypted Plus. - Длина: около 15 секунд целыми тактами, 7-8 кадров. - Обязательно: год основания 2017, настоящий логотип Incrypted, перерисованный векторным кодом из SVG-логотипа в шапке https://incrypted.com/en/ (без файлов изображений), рост аудитории, конференция. - Весь текст в кадре ― на английском. - Бери факты только с https://incrypted.com/en/about/ и из источников, собранных во время исследования. Не выдумывай цифры. - Пройди все шаги SKILL.md, включая отдельного субагента на каждую сцену и волны критики, пока проверка не станет зеленой. Сдай мастер-MP4, MP4 для телефона, HTML-плеер и shots.md. - В конце сообщи общее время работы, число субагентов, количество строк в каждом файле сцены и пропущенные шаги.

Последний пункт промпта нужен для честного сравнения. Он заставляет агента самостоятельно отчитаться о затратах.

Как с задачей справилась Claude Opus 5.5 

Claude Code с Opus 5.5 прошел весь конвейер без остановок и уточняющих вопросов. Итоговый фильм длится 16 секунд: восемь кадров по два такта при темпе 120 ударов в минуту. Склейки приходятся ровно на 2, 4, 6, 8, 10, 12 и 14 секунду.

Логотип модель перерисовала кодом: белый ключ в красном круге узнается и в крупном плане, и на баннере над сценой. Цифры 650+ видео, 400 000+ визитов, 130 000+ и 118 000+ подписчиков совпадают со страницей About. Данные о конференции ― около 2000 участников ― совпадают с отчетами о мероприятии 13 июня 2026 года.

Прогон занял 35 минут 11 секунд. Opus 5.5 задействовала 13 субагентов: восемь на сцены, одного на музыку и четырех критиков. Критики нашли одну проблему приоритета P1 ― подпись на кадре с конференцией не читалась на фоне зала. Ее перенесли на бумажную плашку, что видно в итоговом ролике. Еще семь замечаний P2 и группу мелких P3 агент тоже исправил.

Отдельно стоит отметить два момента. Для правок агент не создавал новых субагентов, а семь раз возобновлял работу тех, кто писал сцены, как и требует скилл. Исправление P1 главный агент проверил сам на свежих кадрах. Музыкальная часть уложилась в требования скилла: все 26 звуковых акцентов попадают в свои метки с точностью до 6,7 мс при допуске 10 мс, а пиковый уровень ― −2,3 dBFS.

Как с задачей справилась GPT-6 Sol 

Codex с GPT-6 Sol тоже прошел конвейер до конца и сдал фильм без вопросов. Ролик длится 15 секунд, в нем восемь кадров. Модель выбрала более медленный темп: такт длится 2,5 секунды, а кадры чередуются по длине ― по такту и по полтакта.

Все цифры в фильме ― 2017, три языка, более 650 видео и 400 000 визитов ― взяты со страницы About. Лишних или непроверяемых данных модель не добавила. Настоящий логотип появляется только в последнем кадре. В первом кадре вместо него стоит условная красная мишень, которая лишь напоминает фирменный круг.

GPT-6 Sol запустила десять субагентов: восемь на сцены и двух критиков. Отдельного субагента для музыки в отчете нет. Файлы сцен получились компактными ― от 126 до 229 строк, всего 1457 строк на восемь кадров. Для сравнения, в эталонном фильме о бабочке средняя сцена занимает около 2000 строк. Общее время прогона агент в отчете не указал, хотя промпт требовал его сообщить.

Opus 5.5 и GPT-6 Sol: результаты 

Обе модели справились с задачей: фильм готов, логотип нарисован кодом, текст в кадре на английском, звук синтезирован. Разница видна в объеме работы, которую каждая модель вложила в конвейер.

Громкость редакция замерила на готовых роликах с помощью ffmpeg, остальные данные взяты из отчетов агентов. Таблица показывает результат одного прогона для каждой модели. Повторный запуск того же промпта может дать другой фильм и другие цифры.

Ограничения

Тест показал сильные стороны обеих моделей, но у подхода есть и ограничения. Их стоит учитывать до запуска собственного фильма.

Цена прогона. Даже 15-секундный фильм требует восьми параллельных субагентов и нескольких раундов критики. У Opus 5.5 прогон занял больше получаса. На подписке это заметная часть пятичасового лимита, в API ― ощутимый счет.

Субагенты в Codex. По документации OpenAI, Codex запускает субагентов по прямой просьбе пользователя или по инструкции в скилле. Число параллельных потоков ограничивает параметр agents.max_concurrent_threads_per_session.

Нагрузка на компьютер. Проверка кадров, контакт-листы и рендер идут через Chromium и ffmpeg на машине пользователя. Параллельные субагенты одновременно рендерят кадры, поэтому слабый компьютер замедлит весь конвейер.

Отчеты агентов. Промпт требовал сообщить время, число субагентов и объем кода, но ни одна модель не выполнила этот пункт полностью. Opus 5.5 не привела число строк, GPT-6 Sol ― время работы. Для точного сравнения расход стоит смотреть в самих инструментах.

Проверка фактов. Скилл требует собирать источники, но не проверяет цифры в кадре автоматически. Opus 5.5 добавила в анимацию счетчика промежуточное значение, которое не удалось подтвердить. Каждую цифру в готовом фильме нужно сверять вручную.

Сравнимость результатов. Тест проведен на одной задаче и одном прогоне для каждой модели. Результат агентной работы меняется от запуска к запуску, поэтому он не заменяет бенчмарки.

Стиль. Скилл заточен под один визуальный язык ― рисунок тушью и чертежи. Для другого стиля агенту нужно сначала разобрать референс и переписать арт-библию, что удлиняет прогон.

Часть ограничений снимается настройками: уровнем усилий, числом параллельных субагентов и длиной фильма. Остальные ― плата за полностью процедурный подход без единого медиафайла.

Какую модель выбрать 

Обе модели довели до конца многоэтапную задачу с параллельными субагентами, исследованием и рендером. Для такого сценария подходят и Opus 5.5, и GPT-6 Sol, а выбор зависит от того, что важнее ― глубина проработки или стоимость.

Opus 5.5 в тесте задействовала больше субагентов и прошла полный цикл критики с измеримым результатом по каждой правке. Это совпадает с заявлением Anthropic о том, что модель эффективнее делегирует работу и проверяет себя. Цена за это ― $4 и $20 за млн токенов и больше получаса на 16-секундный ролик.

GPT-6 Sol выполнила задачу с меньшим числом субагентов и компактным кодом, строго по фактам со страницы About. При цене $2 и $10 за млн токенов она вдвое дешевле Opus 5.5 в API. Это соответствует позиционированию OpenAI, которая делает ставку на стоимость задачи.

При этом самое главное ― качество результата. И выбирая между двумя получившимися роликами, редакция Incrypted отдает свой голос за Opus 5.5.

FAQ

Что лучше - Claude Opus 5.5 или GPT-6 Sol?
По итогам нашего теста редакция Incrypted отдает голос Opus 5.5, но с оговорками. Обе модели довели до конца одну и ту же задачу — сняли процедурный анимационный фильм об истории Incrypted через скилл procedural-film. Opus 5.5 вложила в работу заметно больше: 13 субагентов против десяти, полный цикл волн критики с одной ошибкой приоритета P1, семью P2 и группой мелких P3, а логотип Incrypted она нарисовала кодом и провела через пять кадров из восьми. GPT-6 Sol справилась компактнее и строго по фактам со страницы About, но настоящий логотип появился у нее только в финальном кадре. Если важнее глубина проработки — берите Opus 5.5, если стоимость задачи — GPT-6 Sol вдвое дешевле в API.
Чем отличается Claude Opus 5.5 от GPT-6 Sol?
Это модели разных компаний и с разным позиционированием, хотя вышли они в один день, 22 сентября 2026 года. Opus 5.5 открывает семейство Claude 5.5 и подается как флагманский уровень за меньшие деньги: Anthropic заявляет работу на уровне Claude Fable 5.1 при цене на 40% ниже Opus 5. GPT-6 Sol — не флагман, а основная рабочая модель линейки GPT-6, где флагманом остается Astra, а самой дешевой — Luna. По характеристикам различия невелики: контекстное окно 1 млн токенов у Opus 5.5 против 1,05 млн у Sol, максимальный вывод у обеих 128 000 токенов, знания Opus 5.5 ограничены июнем 2026 года, у Sol — 20 апреля 2026 года. Уровней рассуждений у Opus 5.5 пять, от low до max, и отключить режим нельзя, у Sol их шесть, включая none.
Какая модель дешевле: Claude Opus 5.5 или GPT-6 Sol?
В API дешевле GPT-6 Sol, причем ровно вдвое по обоим направлениям: $2 против $4 за млн входных токенов и $10 против $20 за выходные. Но цена за токен не равна цене за задачу. OpenAI как раз строит анонс вокруг стоимости решения: по ее данным, на AutomationBench 1.0.6 модель набирает 33,2% при $0,27 за задачу, тогда как связка Claude Fable 5.1 с переключением на Opus 5 дает сопоставимые 31,4%, но в 8,9 раза дороже. Anthropic отвечает встречным аргументом: на сопоставимых задачах Opus 5.5 обходится в 20-40% стоимости GPT-6 Astra и GPT-5.6 Sol. Напрямую эти цифры не сравнить — компании считают на разных версиях тестов и меряются с разными моделями.
Какая модель лучше подходит для программирования и AI-агентов?
По официальным бенчмаркам картина складывается в пользу Anthropic, но сравнение неполное. В агентном программировании Opus 5.5 опережает GPT-6 Astra: 66,4% против 57,9% на Terminal-Bench 4.0. Сама GPT-6 Sol в эту таблицу не попала — она вышла на несколько часов позже. OpenAI приводит для Sol другие цифры: 68,8% на DeepSWE v1.1 на уровне max, что на 1,1 п.п. меньше лучшего результата Claude, но примерно на 80% дешевле в расчете на задачу. Отдельно Anthropic отмечает, что Opus 5.5 эффективнее делегирует работу субагентам и проверяет собственную работу — в нашем тесте это подтвердилось: модель прошла полный цикл критики и сама перепроверила исправление на свежих кадрах.
Сколько стоят Claude Opus 5.5 и GPT-6 Sol в API?
Claude Opus 5.5 стоит $4 за млн входных токенов и $20 за млн выходных, чтение из кеша — $0,20. Быстрый режим удваивает цену, до $8 и $40. GPT-6 Sol стоит $2 и $10, кешированный ввод — те же $0,20. Вышедшая вместе с ней GPT-6 Luna заметно дешевле: $0,10 и $0,50, и по данным OpenAI на высоком уровне рассуждений она достигает фактической точности GPT-5.6 Sol примерно за сотую часть цены. Помимо API обе модели доступны по подписке: Opus 5.5 — на тарифах Pro, Max, Team и Enterprise, а также в Amazon Web Services, Google Cloud и Microsoft Azure, а GPT-6 Sol — в ChatGPT Work и Codex на Plus, Pro, Business, Enterprise и Edu.
Какая модель лучше справляется со сложными многоэтапными задачами?
Именно это мы и проверяли на практике. Обе модели получили одинаковый промпт и одинаковый уровень усилий high, а задача включала исследование, раскадровку, параллельную работу субагентов над сценами, синтез музыки, волны критики и рендер. Обе дошли до конца без остановок и уточняющих вопросов, разница — в глубине проработки. Opus 5.5 работала 35 минут 11 секунд и запустила 13 субагентов, а ее музыкальная часть уложилась в требования скилла с запасом: все 26 звуковых акцентов попали в свои метки с точностью до 6,7 мс при допуске 10 мс. GPT-6 Sol обошлась десятью субагентами и компактным кодом — 1457 строк на восемь сцен против примерно 2000 строк на одну сцену в эталонном фильме скилла. Важная оговорка: это один прогон каждой модели, а результат агентной работы меняется от запуска к запуску.

Сообщение Claude Opus 5.5 против GPT-6 Sol: мы дали двум новым AI одну задачу — и вот что из этого вышло появились сначала на INCRYPTED.