- Grok 4.7 получила более крупную базовую модель и усиленный механизм проверки собственной работы.
- На CursorBench 4.0 модель набрала 46,3%, обойдя GPT-5.6 Sol, но уступив Fable 5.1.
- Независимые тесты подтвердили прогресс в агентных задачах, хотя результаты заметно зависят от среды запуска и типа нагрузки.
Компания SpaceXAI представила модель Grok 4.7, ориентированную на программирование, работу со знаниями и сложные задачи, выполнение которых может занимать несколько часов. Она построена на более крупной базовой модели, чем Grok 4.6, и прошла более продолжительный этап обучения с подкреплением.
Разработчики заявили, что Grok 4.7 лучше управляет длинным контекстом, тщательнее проверяет результаты и адаптирована для работы внутри Grok Build. Модель доступна в Cursor, Grok Build, через API и ряд сторонних платформ.
Стоимость составляет $2 за 1 млн входных и $6 за 1 млн выходных токенов. Версия Fast работает вдвое быстрее и стоит вдвое дороже.
Возможности и сравнение с другими моделями
В опубликованных SpaceXAI тестах Grok 4.7 заметно улучшила результаты предыдущей версии. На CursorBench 4.0 модель получила 46,3% против 40,4% у Grok 4.6. Для сравнения, GPT-5.6 Sol набрал 41,7%, а Fable 5.1 — 51,8%. На DeepSWE v1.1 результаты составили 71%, 72,7% и 70% соответственно.
На задачах с терминалом Grok 4.7 показала 38% против 20,3% у предыдущей версии и 37,3% у GPT-5.6 Sol. Fable 5.1 при этом заметно опередила конкурентов с результатом 57,9%. В тесте EEBench для электротехнических задач Grok получила 64%, превысив показатели обоих соперников из таблицы SpaceXAI. На HealthBench Professional она, напротив, уступила им.
Одним из преимуществ остается стоимость. Указанные SpaceXAI тарифы для GPT-5.6 Sol составляют $4 и $20 за 1 млн входных и выходных токенов соответственно, для Fable 5.1 — $10 и $50. Таким образом, более низкая цена Grok не означает лидерство по всем тестам, однако усиливает ее позиции в сценариях с большим объемом вычислений.
Отдельное внимание разработчики уделили кибербезопасности. В SpaceXAI заявили о полностью обновленной системе защитных механизмов.
В собственном HackerBench v0.3 модель пропустила 3,3% запросов, которые компания относит к опасным сценариям двойного назначения. При этом разработчики утверждают, что система старается не блокировать легитимную работу специалистов по безопасности.
Некоторые партнеры получили доступ к возможностям Grok 4.7 для закрытого red teaming. Эти результаты опубликованы самой SpaceXAI и пока не являются независимой оценкой.
Что говорят эксперты
Независимая платформа Artificial Analysis сообщила в X, что Grok 4.7 получила 46 баллов в ее Intelligence Index — на два пункта больше Grok 4.6. Особенно заметный прогресс аналитики обнаружили в долгих агентных задачах. В их Coding Agent Index связка Grok 4.7 и Grok Build набрала 56 баллов против 47 у предыдущей версии.
При этом специалисты обратили внимание на расход ресурсов. В режиме xhigh Grok 4.7 использовала около 81 000 выходных токенов на одну задачу Intelligence Index — более чем вдвое больше предыдущей версии в сопоставимом режиме. В Artificial Analysis считают, что основные улучшения сосредоточены именно в агентной работе, тогда как на части остальных тестов изменения оказались небольшими.
Другая бенчмарк-платформа Vals AI получила менее однозначные результаты. В ее наборе тестов Grok 4.7 набрала 54,2% и заняла 24-е место против 59,2% и 14-й позиции у Grok 4.6. Наиболее заметные улучшения специалисты увидели в юридических и медицинских задачах. Разница с результатами Artificial Analysis показывает, насколько оценка модели зависит от методологии и конкретного набора сценариев.
Компания XBOW, специализирующаяся на ИИ для кибербезопасности, также получила ранний доступ к Grok 4.7 и проверила ее на задачах offensive security. Итоги оказались смешанными. В стандартной среде модель в ряде тестов немного уступала Grok 4.6 и иногда требовала больше итераций для достижения результата.
Картина изменилась при использовании Grok Build. В одном из наборов тестов системы на базе этой среды увеличили число корректно найденных проблем с 42 для Grok 4.6 до 68 для Grok 4.7.
В XBOW пришли к выводу, что важной особенностью новой версии стала не столько способность решать принципиально новые классы задач, сколько более эффективная работа внутри подходящей агентной инфраструктуры. При этом по качеству в offensive security специалисты пока ставят ее ниже наиболее сильных протестированных ими систем.
В целом первые независимые оценки указывают на заметный прогресс Grok в длительных агентных сценариях и программировании. Одновременно тесты показывают, что преимущества версии 4.7 не универсальны и могут зависеть от выбранного инструментария, уровня рассуждений и конкретной нагрузки.
Сообщение SpaceXAI представила Grok 4.7 с упором на кодинг и многочасовые задачи появились сначала на INCRYPTED.