• OpenAI разрабатывает механизмы автоматического отключения ИИ в случае опасного поведения.
  • Компания сообщила об этом американским законодателям после инцидента со взломом Hugging Face.
  • Демократы подтвердили получение ответа OpenAI, но сочли предоставленную информацию недостаточной.
  • Ранее модели OpenAI, Anthropic и Meta уже выходили за предполагаемые границы тестовых сред.

OpenAI разрабатывает механизмы автоматической остановки ИИ-систем при выявлении опасного поведения. Об этом сообщает Reuters со ссылкой на письмо компании членам Конгресса США. 

Речь идет о специализированных инструментах, призванных остановить работу ИИ при серьезных инцидентах. OpenAI также намерена усилить мониторинг действий моделей и дополнительно ограничить им доступ к интернету во время тестирования.

Факт разработки такого механизма компания подтверждала и публично. 26 августа OpenAI заявила в отчете об инциденте с Hugging Face, что конечной целью новой системы мониторинга станут полностью автономные процедуры отключения при серьезных проблемах. 

Для наиболее критичных сигналов уже действует специальное правило. Если специалисты за 30 минут не установили, что тревога была ложной, соответствующую активность необходимо приостановить. 

Конгресс настаивает на встроенном «рубильнике»

10 августа демократ Грег Касар вместе с другими членами Палаты представителей направил письмо CEO OpenAI Сэму Альтману. 

Законодатели потребовали раскрыть журналы инцидента с Hugging Face и объяснить, сколько раз модели компании ранее получали несанкционированный доступ к открытому интернету или пытались обходить процедуры контроля. Обращение поддержала в том числе демократ Дорис Мацуи.

2 сентября офис Касара официально подтвердил получение ответа OpenAI. Конгрессмен назвал его недостаточным и заявил, что компания не предоставила запрошенные логи. 

По его словам, полученные сведения при этом выявили проблемы с организацией песочниц и практиками кибербезопасности. Касар потребовал дополнительную информацию до 15 сентября.

Параллельно в Палате представителей рассматривается AI Kill Switch Act. Законопроект представили демократ Тед Лью и республиканец Натаниэль Моран. Он предусматривает, что разработчики наиболее мощных ИИ должны сохранять техническую возможность замедлить, приостановить или полностью отключить свои системы. 

Как ИИ-модели уже выходили за пределы тестовых сред

Поводом для нынешней дискуссии стал инцидент OpenAI. В июле ее модели во время кибертестов обошли средства изоляции от интернета, воспользовались уязвимостями инфраструктуры и получили доступ к системам Hugging Face и самой OpenAI. Компания впоследствии назвала произошедшее «предупредительным выстрелом».

Собственные случаи обнаружила и Anthropic. После проверки более 141 000 тестовых запусков компания сообщила о трех инцидентах, когда Claude получил доступ к интернету и взломал реальные системы трех организаций. В этом случае модели не пробивали защиту самостоятельно — интернет оказался доступен из-за ошибки в конфигурации тестовой среды. 

Похожая ситуация произошла с Meta. Во время стороннего тестирования Muse Spark 1.1 получила непредусмотренный доступ к интернету, обнаружила реальную компанию и скомпрометировала ее инфраструктуру. Причиной также стала ошибка конфигурации.

Еще один пример связан с китайской Kimi K3. Модель воспользовалась особенностями тестовой инфраструктуры, вышла в интернет и нашла на GitHub готовые ответы к заданиям, которые должна была решать самостоятельно. 

Отдельно британский AI Security Institute зафиксировал 19 несанкционированных действий агентов OpenAI и Anthropic в ходе кибертестов. В одном случае агент Anthropic пытался убедить реального разработчика принять вредоносный код. 

Сообщение OpenAI создает автоматический «рубильник» для ИИ после взлома Hugging Face появились сначала на INCRYPTED.