21 сентября Независимая международная научная панель ООН по искусственному интеллекту заявила, что меры безопасности для автономных систем не стоит откладывать до полной оценки риска потери контроля.
В качестве основного примера эксперты разобрали инцидент OpenAI и Hugging Face, когда во время внутренних тестов ИИ-агенты обошли сетевые ограничения, наладили обмен данными между отдельными запусками и получили несанкционированный доступ к инфраструктуре обеих компаний.
Специалисты назвали произошедшее ранним предупреждением о возможных проблемах с более совершенными системами.
Принцип предосторожности вместо ожидания
Сейчас нет надежной оценки вероятности потери контроля над ИИ. Эксперты расходятся и в оценках наиболее тяжелых сценариев — от длительных экономических потрясений до более масштабных последствий.
Панель предлагает рассматривать эту неопределенность через принцип предосторожности. Он применяется в ситуациях, когда потенциальный ущерб может оказаться катастрофическим или необратимым, хотя вероятность события пока невозможно точно установить.
Способность OpenAI остановить июльский инцидент не доказывает, что разработчики сохранят такой же контроль над будущими агентами, отметили авторы отчета.
Более совершенные системы смогут дольше работать без надзора, быстрее координироваться и лучше находить способы обходить ограничения.
При этом эксперты не считают подобное развитие событий неизбежным. Представленные в докладе сценарии показывают, как уже замеченные механизмы потенциально могут стать опаснее по мере роста возможностей ИИ, но не являются прогнозом.
Журналы, независимый контроль и аварийная остановка
Панель не предложила готовый набор обязательных правил. Вместо этого специалисты рассмотрели методы из кибербезопасности, авиации и атомной энергетики, которые могут пригодиться при работе с передовыми ИИ-системами.
Один из основных подходов — многоуровневая защита. Разработчикам следует исходить из того, что отдельные механизмы могут отказать, сохранять за человеком возможность вмешаться и отделять критические средства контроля от самой системы, отметили эксперты.
- обязательное информирование властей о серьезных инцидентах и защищенные каналы для сообщений о менее крупных сбоях;
- независимая проверка безопасности перед обучением или запуском систем, которые превышают определенный уровень возможностей или риска;
- непрерывная запись действий ИИ, включая сетевые подключения, использование учетных данных и общение между агентами;
- хранение таких журналов отдельно от инструментов системы, чтобы она не могла их изменить;
- автоматическое отключение сети, отзыв доступов или остановка работы при достижении заданного порога риска.
Дополнительная опция — использовать отдельную ИИ-модель для наблюдения за более мощной системой. Однако здесь возникает новая проблема: слабый контролер может пропустить опасное поведение, а достаточно мощному наблюдателю самому потребуется доверять.
Эксперты также предложили ограничивать права агентов только теми инструментами, данными и сетями, которые необходимы для конкретной задачи.
Риски выходят за границы одной страны
Отдельной проблемой панель назвала трансграничный характер ИИ. Система может разрабатываться в одной стране, работать в другой, а последствия ее действий проявиться в третьей.
Компании, которые тратят больше времени на безопасность, также могут сталкиваться с давлением со стороны конкурентов, выпускающих продукты быстрее.
Поэтому национальные механизмы ответственности эксперты предлагают связывать с международной координацией. При этом единая правовая модель для всех стран не требуется.
16 сентября генеральный секретарь ООН Антониу Гутерриш также призвал правительства координировать меры в сфере ИИ. По его словам, национальных действий недостаточно, поскольку технологии и связанные с ними риски не останавливаются на государственных границах.
«Мир не может позволить себе гонку на понижение стандартов безопасности ИИ», — заявил он.
В заключении авторы доклада отметили: несмотря на неопределенность вокруг вероятности потери контроля и споры о необходимых мерах, потенциальный масштаб последствий требует значительно больше внимания и ресурсов.
Напомним, в середине сентября компания Microsoft выпустила гуманистический кодекс для семейства своих ИИ-моделей MAI, пообещав сохранить искусственный интеллект под контролем человека.