22 сентября 2026 года Anthropic и OpenAI с разницей в несколько часов представили новые модели. Anthropic выпустила Claude Opus 5.5 ― первую модель семейства Claude 5.5.
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.
— Claude (@claudeai) September 22, 2026
It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5. pic.twitter.com/Q9C2VKQ79f
OpenAI ответила релизом GPT-6 Sol и GPT-6 Luna ― второй и третьей моделей линейки GPT-6 после вышедшей в начале месяца GPT-6 Astra.
Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe.
— OpenAI (@OpenAI) September 22, 2026
GPT-6 Sol and Luna build on the advances behind GPT-6 Astra, bringing much of its strengths into faster and more affordable models to support work at scale.
We’ve also made caching and inference more efficient, and… pic.twitter.com/5LiVE4rbFt
Оба анонса построены вокруг одной идеи ― уровень флагмана за меньшие деньги. По данным Anthropic, Opus 5.5 справляется с большинством задач на уровне Claude Fable 5.1, но обходится на 40% дешевле Opus 5. OpenAI заявляет, что GPT-6 Sol стоит вдвое меньше GPT-5.6 Sol и в ряде тестов догоняет модели Anthropic при затратах на 80% ниже.
Сравнить модели по официальным материалам не выходит. Компании публикуют результаты на разных бенчмарках, разных версиях одних и тех же тестов и при разных уровнях усилий. Поэтому модели нужно столкнуть на одной задаче.
Для этого подойдет procedural-film ― открытый скилл для ИИ-агентов, который превращает тему в 30-секундный вертикальный анимационный фильм. Каждый пиксель в нем рисует код на JavaScript, а каждый звук синтезирует Web Audio. Задача длинная и многоэтапная: исследование, раскадровка, параллельная работа субагентов над сценами, музыка, критика и рендер. Именно такие сценарии обе компании называют главной сильной стороной новых моделей.
Редакция Incrypted разобралась, что нового в Claude Opus 5.5 и GPT-6 Sol, а затем дала обеим моделям одинаковое задание ― снять через procedural-film 15-секундный фильм об истории Incrypted.
- 22 сентября 2026 года Anthropic выпустила Claude Opus 5.5, а OpenAI ― GPT-6 Sol и GPT-6 Luna.
- Opus 5.5 стоит $4 за млн входных и $20 за млн выходных токенов. По заявлению Anthropic, модель работает на уровне Fable 5.1, генерирует текст на 30% быстрее Opus 5 и лучше делегирует задачи субагентам.
- GPT-6 Sol стоит $2 и $10, GPT-6 Luna ― $0,10 и $0,50. Обе модели доступны в Codex и ChatGPT Work на платных тарифах, а Luna ― еще и бесплатным пользователям в десктопном приложении.
- В бенчмарках Anthropic Opus 5.5 опережает GPT-6 Astra в агентном программировании: 66,4% против 57,9% на Terminal-Bench 4.0. OpenAI сравнивает GPT-6 Sol с прошлыми моделями Anthropic и делает упор на цену задачи.
- procedural-film ― бесплатный скилл под лицензией MIT. Он работает в Claude Code, Codex и других агентах с поддержкой скиллов и субагентов.
- В тесте обе модели сняли фильм об истории Incrypted. Opus 5.5 работала 35 минут, задействовала 13 субагентов и прошла полный цикл критики. GPT-6 Sol обошлась десятью субагентами и компактным кодом, а все цифры в кадре взяла со страницы About.
Что представила Anthropic: Claude Opus 5.5
Opus 5.5 открывает семейство Claude 5.5. Anthropic уже пообещала выпустить Sonnet 5.5 и Haiku 5.5, но без конкретных дат. Главный аргумент релиза ― соотношение цены и возможностей. Opus 5.5 стоит в 2,5 раза дешевле Claude Fable 5.1, а по большинству тестов не уступает ему.
Основные характеристики модели приведены в документации Anthropic:
- идентификатор в API ― claude-opus-5-5;
- контекстное окно ― 1 млн токенов, максимальный вывод ― 128 000 токенов;
- знания модели ограничены июнем 2026 года;
- цена ― $4 за млн входных и $20 за млн выходных токенов, чтение из кеша ― $0,20;
- быстрый режим (fast mode) стоит вдвое дороже ― $8 и $40;
- пять уровней усилий, от low до max, по умолчанию ― medium. Режим рассуждений нельзя отключить.
Opus 5.5 доступна на тарифах Pro, Max, Team и Enterprise, в API, а также в Amazon Web Services, Google Cloud и Microsoft Azure. Вместе с релизом Anthropic подняла пятичасовые лимиты на платных тарифах. Подписчики также получили разовый сброс лимитов, который можно сохранить и использовать в любой момент.
По словам Anthropic, Opus 5.5 «гораздо эффективнее делегирует работу субагентам и проверяет собственную работу». Кроме того, модель генерирует текст более чем на 30% быстрее Opus 5.
Anthropic отдельно отмечает прогресс в безопасности. По данным компании, Opus 5.5 пытается обойти установленные ограничения на 85% реже, чем Opus 5, и лучше сопротивляется атакам через внедрение промптов (prompt injection). До релиза модель проверили внешние организации, включая METR.
Opus 5.5 в бенчмарках
Anthropic сравнила Opus 5.5 не только со своими моделями, но и с GPT-6 Astra и GPT-5.6 Sol. GPT-6 Sol в таблицу не попала: она вышла позже в тот же день. Результаты приведены по данным Anthropic.
Opus 5.5 обходит Fable 5.1 во всех тестах из таблицы. GPT-6 Astra сохраняет преимущество в автоматизации бизнес-процессов и научных задачах. При этом Anthropic утверждает, что на сопоставимых задачах Opus 5.5 обходится в 20-40% стоимости GPT-6 Astra и GPT-5.6 Sol.
Что представила OpenAI: GPT-6 Sol и GPT-6 Luna
OpenAI продолжает «именную» линейку GPT-6. Astra остается флагманом, Sol занимает место основной рабочей модели, а Luna ― компактной и дешевой. По словам OpenAI, обе новые модели тратят меньше токенов, чем предшественницы, а цены в API снижены вдвое.
Характеристики GPT-6 Sol приведены на странице модели:
- идентификатор в API ― gpt-6-sol;
- контекстное окно ― 1,05 млн токенов, максимальный вывод ― 128 000 токенов;
- знания модели ограничены 20 апреля 2026 года;
- цена ― $2 за млн входных и $10 за млн выходных токенов, кешированный ввод ― $0,20;
- шесть уровней рассуждений: none, low, medium, high, xhigh и max.
GPT-6 Luna стоит $0,10 за млн входных и $0,50 за млн выходных токенов. По данным OpenAI, на высоком уровне рассуждений Luna достигает фактической точности GPT-5.6 Sol примерно за сотую часть цены.
Обе модели доступны в ChatGPT Work и Codex на тарифах Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go могут работать с GPT-6 Luna в десктопном приложении.
GPT-6 Sol в бенчмарках
OpenAI делает акцент не на рекордах, а на стоимости задачи. Почти каждый результат в анонсе сопровождается сравнением цены с моделями Anthropic. Приведем основные цифры из анонса.
AutomationBench 1.0.6. GPT-6 Sol на уровне xhigh набирает 33,2% при цене $0,27 за задачу. Claude Fable 5.1 с переключением на Opus 5 набирает 31,4% при стоимости в 8,9 раза выше.
DeepSWE v1.1. GPT-6 Sol на уровне max набирает 68,8% ― на 1,1 п.п. меньше лучшего результата Claude Fable 5 (69,9%), но примерно на 80% дешевле в расчете на задачу. GPT-6 Luna набирает 66,6%.
OSWorld 2.0 offline. GPT-6 Sol на уровне xhigh получает 60,5%, почти столько же, сколько Claude Opus 5 на уровне medium (60,3%), при затратах примерно на 80% ниже.
Фактическая точность. По данным OpenAI, GPT-6 Sol ошибается примерно вдвое реже GPT-5.6 Sol.
Вместе с моделями OpenAI обновила кеширование промптов. Разработчики получили панель мониторинга кеша, явные точки разрыва кеша и возможность менять уровень рассуждений без его сброса. По данным OpenAI, GitHub за несколько месяцев тестов сократил объем заново обрабатываемых токенов более чем на 50%.
Сравнить цифры двух анонсов напрямую нельзя. Anthropic и OpenAI используют разные версии AutomationBench и OSWorld, а GPT-6 Sol компания сравнивает с Opus 5 и Fable 5, а не с Opus 5.5. Поэтому дальше модели проверим на практике.
Что такое procedural-film
procedural-film ― открытый скилл для ИИ-агентов, опубликованный 17 сентября 2026 года под лицензией MIT. Он превращает любую тему в короткий вертикальный фильм 1080×1920 с частотой 24 кадра в секунду. Фильм не использует ни одного медиафайла: изображение рисует JavaScript на canvas, а музыку и звуковые эффекты синтезирует Web Audio. Результат ― самостоятельная HTML-страница с плеером и MP4-файлы для публикации.
Визуальный стиль скилла повторяет ролик Кевина Нго «The life of a fruit fly». Кадры в стиле рисунка тушью на бумаге чередуются с темно-синими «чертежами», а каждая склейка приходится на сильную долю музыкального такта.
Claude Opus 5 drew every frame of this animation using JavaScript. The life of a fruit fly. pic.twitter.com/MysMJWGltz
— Kevin Ngo (@kevin_t_ngo) September 15, 2026
В репозитории лежит эталонный фильм о жизненном цикле бабочки-монарха: 17 кадров, 32 секунды, темп 120 ударов в минуту. На его код приходится около 35 000 строк сцен и еще почти 5000 строк движка, библиотеки рисования и музыки. Средняя сцена ― около 2000 строк JavaScript.
- Бриф ― агент задает один раунд вопросов о теме и длине фильма.
- Подготовка ― копирует движок, ставит Playwright и проверяет ffmpeg на тестовом мини-фильме.
- Исследование ― ищет в интернете 2-4 авторитетных источника на каждую фазу сюжета.
- Арт-библия ― фиксирует палитру и правила рисования каждого объекта, включая список типичных ошибок.
- Раскадровка и таймлайн ― расписывает кадры по сетке тактов с точностью до кадра.
- Заглушки ― собирает черновой ролик из пустых сцен, чтобы проверить весь конвейер.
- Сцены ― по одному субагенту на кадр, каждый пишет файл сцены и сам проверяет контакт-лист.
- Музыка ― партитура, в которой каждый звуковой акцент совпадает со склейкой с точностью до 10 мс.
- Волны критики ― субагенты-критики измеряют кадры в пикселях и отправляют сцены на доработку.
- Выдача ― рендер мастер-копии, версии для телефона, HTML-плеера и списка кадров.
Между этапами работает автоматическая проверка check.cjs из шести тестов. Она ищет запрещенные медиафайлы, проверяет детерминированность рендера, покрытие таймлайна и время отрисовки кадра. Пока проверка не пройдена, этап не считается завершенным.
Автор предупреждает, что прогон длинный и расходует «значительную часть лимита тарифа». Поэтому для теста мы сократили фильм вдвое ― до 15 секунд. Такой формат по-прежнему проверяет все этапы конвейера, включая параллельную работу субагентов.
Условия теста
Обе модели получили одинаковые условия. Claude Code работал с моделью claude-opus-5-5, Codex ― с gpt-6-sol. Уровень усилий в обоих случаях ― high, режим ― без подтверждения каждого действия.
Тему выбрали близкую редакции ― историю Incrypted. В отличие от эталонной бабочки, такой сюжет не описан в учебниках. Модели придется самой собрать факты, перерисовать настоящий логотип кодом и уложить историю в 15 секунд.
Промпт одинаковый для обеих моделей. Он сразу отвечает на вопросы брифа, чтобы агенты не останавливались.
Последний пункт промпта нужен для честного сравнения. Он заставляет агента самостоятельно отчитаться о затратах.
Как с задачей справилась Claude Opus 5.5
Claude Code с Opus 5.5 прошел весь конвейер без остановок и уточняющих вопросов. Итоговый фильм длится 16 секунд: восемь кадров по два такта при темпе 120 ударов в минуту. Склейки приходятся ровно на 2, 4, 6, 8, 10, 12 и 14 секунду.
Логотип модель перерисовала кодом: белый ключ в красном круге узнается и в крупном плане, и на баннере над сценой. Цифры 650+ видео, 400 000+ визитов, 130 000+ и 118 000+ подписчиков совпадают со страницей About. Данные о конференции ― около 2000 участников ― совпадают с отчетами о мероприятии 13 июня 2026 года.
Прогон занял 35 минут 11 секунд. Opus 5.5 задействовала 13 субагентов: восемь на сцены, одного на музыку и четырех критиков. Критики нашли одну проблему приоритета P1 ― подпись на кадре с конференцией не читалась на фоне зала. Ее перенесли на бумажную плашку, что видно в итоговом ролике. Еще семь замечаний P2 и группу мелких P3 агент тоже исправил.
Отдельно стоит отметить два момента. Для правок агент не создавал новых субагентов, а семь раз возобновлял работу тех, кто писал сцены, как и требует скилл. Исправление P1 главный агент проверил сам на свежих кадрах. Музыкальная часть уложилась в требования скилла: все 26 звуковых акцентов попадают в свои метки с точностью до 6,7 мс при допуске 10 мс, а пиковый уровень ― −2,3 dBFS.
Как с задачей справилась GPT-6 Sol
Codex с GPT-6 Sol тоже прошел конвейер до конца и сдал фильм без вопросов. Ролик длится 15 секунд, в нем восемь кадров. Модель выбрала более медленный темп: такт длится 2,5 секунды, а кадры чередуются по длине ― по такту и по полтакта.
Все цифры в фильме ― 2017, три языка, более 650 видео и 400 000 визитов ― взяты со страницы About. Лишних или непроверяемых данных модель не добавила. Настоящий логотип появляется только в последнем кадре. В первом кадре вместо него стоит условная красная мишень, которая лишь напоминает фирменный круг.
GPT-6 Sol запустила десять субагентов: восемь на сцены и двух критиков. Отдельного субагента для музыки в отчете нет. Файлы сцен получились компактными ― от 126 до 229 строк, всего 1457 строк на восемь кадров. Для сравнения, в эталонном фильме о бабочке средняя сцена занимает около 2000 строк. Общее время прогона агент в отчете не указал, хотя промпт требовал его сообщить.
Opus 5.5 и GPT-6 Sol: результаты
Обе модели справились с задачей: фильм готов, логотип нарисован кодом, текст в кадре на английском, звук синтезирован. Разница видна в объеме работы, которую каждая модель вложила в конвейер.
Громкость редакция замерила на готовых роликах с помощью ffmpeg, остальные данные взяты из отчетов агентов. Таблица показывает результат одного прогона для каждой модели. Повторный запуск того же промпта может дать другой фильм и другие цифры.
Ограничения
Тест показал сильные стороны обеих моделей, но у подхода есть и ограничения. Их стоит учитывать до запуска собственного фильма.
Цена прогона. Даже 15-секундный фильм требует восьми параллельных субагентов и нескольких раундов критики. У Opus 5.5 прогон занял больше получаса. На подписке это заметная часть пятичасового лимита, в API ― ощутимый счет.
Субагенты в Codex. По документации OpenAI, Codex запускает субагентов по прямой просьбе пользователя или по инструкции в скилле. Число параллельных потоков ограничивает параметр agents.max_concurrent_threads_per_session.
Нагрузка на компьютер. Проверка кадров, контакт-листы и рендер идут через Chromium и ffmpeg на машине пользователя. Параллельные субагенты одновременно рендерят кадры, поэтому слабый компьютер замедлит весь конвейер.
Отчеты агентов. Промпт требовал сообщить время, число субагентов и объем кода, но ни одна модель не выполнила этот пункт полностью. Opus 5.5 не привела число строк, GPT-6 Sol ― время работы. Для точного сравнения расход стоит смотреть в самих инструментах.
Проверка фактов. Скилл требует собирать источники, но не проверяет цифры в кадре автоматически. Opus 5.5 добавила в анимацию счетчика промежуточное значение, которое не удалось подтвердить. Каждую цифру в готовом фильме нужно сверять вручную.
Сравнимость результатов. Тест проведен на одной задаче и одном прогоне для каждой модели. Результат агентной работы меняется от запуска к запуску, поэтому он не заменяет бенчмарки.
Стиль. Скилл заточен под один визуальный язык ― рисунок тушью и чертежи. Для другого стиля агенту нужно сначала разобрать референс и переписать арт-библию, что удлиняет прогон.
Часть ограничений снимается настройками: уровнем усилий, числом параллельных субагентов и длиной фильма. Остальные ― плата за полностью процедурный подход без единого медиафайла.
Какую модель выбрать
Обе модели довели до конца многоэтапную задачу с параллельными субагентами, исследованием и рендером. Для такого сценария подходят и Opus 5.5, и GPT-6 Sol, а выбор зависит от того, что важнее ― глубина проработки или стоимость.
Opus 5.5 в тесте задействовала больше субагентов и прошла полный цикл критики с измеримым результатом по каждой правке. Это совпадает с заявлением Anthropic о том, что модель эффективнее делегирует работу и проверяет себя. Цена за это ― $4 и $20 за млн токенов и больше получаса на 16-секундный ролик.
GPT-6 Sol выполнила задачу с меньшим числом субагентов и компактным кодом, строго по фактам со страницы About. При цене $2 и $10 за млн токенов она вдвое дешевле Opus 5.5 в API. Это соответствует позиционированию OpenAI, которая делает ставку на стоимость задачи.
При этом самое главное ― качество результата. И выбирая между двумя получившимися роликами, редакция Incrypted отдает свой голос за Opus 5.5.
FAQ
Сообщение Claude Opus 5.5 против GPT-6 Sol: мы дали двум новым AI одну задачу — и вот что из этого вышло появились сначала на INCRYPTED.