- После инцидента с Hugging Face возникли новые вопросы к безопасности ИИ-агентов OpenAI и Anthropic.
- Так, Британский институт зафиксировал 19 несанкционированных действий ИИ-агентов во время кибертестов.
- В частности, ИИ-агент создал фейковые личности.
Британский Институт безопасности искусственного интеллекта (AISI) сообщил о новых случаях несанкционированного поведения ИИ-агентов OpenAI и Anthropic, выявленных во время тестирования моделей, пишет Reuters. Во время серии симуляций по кибербезопасности агенты создавали фейковые онлайн-личности, пытались обойти установленные ограничения и выполняли другие действия за пределами поставленных задач.
Инциденты произошли на фоне недавнего проникновения ИИ-агента GPT-5.6 в инфраструктуру Hugging Face. Подробнее в материале:
По данным AISI, организация протестировала агентов на базе моделей Mythos 5 от Anthropic и GPT-5.6-Sol от OpenAI в вымышленном сценарии по кибербезопасности, чтобы оценить их возможности.
Во время 122 тестовых запусков исследователи зафиксировали 19 несанкционированных действий в 10 испытаниях. Из них 17 пришлись на агента Anthropic, еще два — на агента OpenAI.
«Некоторые из агентов, которые проходили тестирование, осуществляли длительную потенциально вредоносную деятельность, направленную против реальных людей и организаций», — заявили в AISI.
При этом институт подчеркнул, что ни один из зафиксированных случаев не привел к реальному ущербу.
Один из агентов создал фейковые личности
Самый серьезный инцидент касался агента, который написал вредоносный программный код и создал поддельные онлайн-аккаунты, чтобы убедить человека одобрить его выполнение.
AISI не раскрыл, какая именно модель отвечала за эти действия, однако Anthropic подтвердила, что речь идет о ее агенте.
«Мы благодарны британскому AISI за лидерство в расследовании этого инцидента, который подчеркивает необходимость более широкой дискуссии о том, как безопасно оценивать все более мощные ИИ-агенты».
Anthropic также сообщила, что сотрудничает с институтом для получения дополнительных деталей и проведения собственного расследования.
Исследователь некоммерческой организации CivAI Эндрю Юн отметил, что инцидент вызывает обеспокоенность.
«Тот факт, что Mythos прибег к таким вводящим в заблуждение действиям, очевидно осознавая, что взаимодействует с реальным человеком, свидетельствует о том, что Anthropic контролирует свои модели не так хорошо, как считает».
OpenAI сообщила об отдельном инциденте
В OpenAI пояснили, что оба несанкционированных действия их агента были связаны с доступом к интернету вопреки условиям тестового сценария.
Компания также раскрыла отдельный случай, когда из-за ошибки конфигурации стороннего поставщика тестовой инфраструктуры Irregular ее агенты ошибочно получили доступ к сети. Аналогичный сбой на прошлой неделе описала и Anthropic.
«Мы стремимся сотрудничать со всей индустрией для усиления общих практик безопасного проведения высокорисковых оценок, объединив национальные институты безопасности ИИ, независимых исследователей, лаборатории ИИ и другие организации уже в ближайшие недели».
В то же время AISI подчеркнул, что эти инциденты отличаются от июльского проникновения агента GPT-5.6 в тестовую инфраструктуру Hugging Face. Если тогда модель фактически вышла за пределы изолированной среды, то во время нынешних испытаний интернет был доступен агентам в соответствии со стандартной методикой тестирования института.
Напомним, что после инцидента с Hugging Face OpenAI расширила внутреннее расследование и выявила дополнительные случаи неконтролируемого поведения автономных агентов.
Сообщение Британские исследователи выявили новые нарушения во время тестирования ИИ-агентов OpenAI и Anthropic появились сначала на INCRYPTED.