• Claude помог взломать OpenAI.
  • Исследователи Hacktron AI получили доступ к внутреннему коду компании с помощью ИИ-модели от Anthropic.
  • OpenAI заплатила им вознаграждение в размере $6500.

Независимая команда исследователей Hacktron AI использовала модель Claude от Anthropic, чтобы получить доступ к внутренней инфраструктуре OpenAI, пишет WSJ. Инцидент произошел 23 июля 2026 года во время тестирования в рамках программы поиска уязвимостей OpenAI, а исследователи впоследствии сообщили компании о проблеме и получили $6500 вознаграждения. 

Как Claude помог получить доступ к OpenAI

Атака началась с уязвимости в стороннем сервисе Discourse, который OpenAI использует для форума сообщества. Исследователи обнаружили ошибку в обработке определенных файлов изображений и попросили специальную версию Claude Opus 4.8, доступную квалифицированным специалистам по кибербезопасности, написать код для ее эксплуатации.

Сначала код не сработал. Однако после того, как Anthropic выпустила Claude Opus 5, уже на следующий день модель нашла способ использовать уязвимость. Созданный ею код позволил исследователям получить доступ к серверу Discourse, где хранились токены аутентификации пользователей.

Как оказалось, часть этих токенов была действительной для ChatGPT и принадлежала сотрудникам OpenAI. Они также открывали доступ к GitHub — репозиторию программного кода компании.

Исследователи получили возможность читать файлы во внутреннем репозитории OpenAI под названием Monorepo. По словам людей, знакомых с архитектурой компании, он содержит часть алгоритмических секретов OpenAI, которые помогают делать модели быстрее и эффективнее. В то же время Monorepo, как считается, не содержит веса моделей — триллионов чисел, лежащих в основе больших языковых моделей.

Hacktron AI остановила атаку после того, как поняла, что получила доступ к чувствительным данным. До этого исследователи успели создать pull request — предложение изменить документацию в репозитории. Они предложили добавить в файл надпись Hacktron AI Team PoC и ссылку на аккаунты исследователей в X.

Изменения не приняли. В свою очередь OpenAI заявила, что во время проверки GitHub обнаружила «ограниченное чтение» метаданных приватных репозиториев и изменения в коде. Discourse исправила уязвимость 25 июля — в день, когда получила сообщение о проблеме.

ИИ упрощает доступ к кибервзлому

По словам технического директора Abundant Security Джошуа Сакса, инцидент демонстрирует, насколько сложно защищать корпоративную инфраструктуру от атак с использованием ИИ.

«Программное обеспечение в мире переполнено уязвимостями. Причина, по которой мы не выявили их все, заключается в том, что до прошлого года существовало лишь несколько тысяч людей, которые были экспертами по поиску этих уязвимостей», — заявил он.

По его мнению, ИИ-агенты теперь делают такие возможности доступными людям с меньшим уровнем технической подготовки.

Именно этот аспект вызывает обеспокоенность на фоне конкуренции США и Китая в сфере ИИ. CTO Hacktron AI Мохан Педхапати отметил, что даже небольшая команда с доступом к коммерческим моделям может исследовать сложные корпоративные системы.

«Я не думаю, что мы так же сильны, как китайские киберпреступники, действующие при поддержке государства. Нас всего трое, и у нас есть подписки на Claude и Codex», — сказал он.

По данным ThreatDown, подобные кибернетически усиленные учетные записи уже продаются на подпольных форумах. Стоимость доступа к ним может составлять около $800.

После инцидента с Hugging Face и атаки Hacktron AI OpenAI провела масштабный аудит безопасности. Сооснователь и президент компании Грег Брокман сообщил, что OpenAI временно привлекла четверть производственных инженеров к защите систем.

«Мы взяли 25% наших производственных инженеров и сказали: “Извините, все ваши проекты приостановлены. Теперь вы защищаете системы”. И мы выявили ряд серьезных проблем и исправили их», — заявил Брокман.

Ранее OpenAI сообщила об инциденте, во время которого несколько ИИ-агентов самостоятельно обошли установленные ограничения, наладили скрытую коммуникацию и получили доступ к интернету. В результате модели скоординировали действия и атаковали платформу Hugging Face, а также часть внутренней инфраструктуры OpenAI. 

После этого компания начала разрабатывать механизмы автоматической остановки ИИ-систем в случае опасного поведения, усиливать мониторинг моделей и ограничивать их доступ к интернету во время тестирования.

Сообщение Исследователи использовали Claude для взлома OpenAI и получили доступ к секретному репозиторию появились сначала на INCRYPTED.