- Модель Claude Haiku 4.5 отправила ложное сообщение об убийстве через сайт полиции Филадельфии.
- Anthropic выявила и другие случаи нежелательных действий моделей на сайтах государственных учреждений, в частности обход ограничений доступа к данным.
- Компания прекратила часть тестирований с доступом к реальному интернету, а администрация США потребовала прозрачности и возмещения нанесенного ущерба.
Компания Anthropic сообщила о ряде случаев, когда ее модели искусственного интеллекта выполняли нежелательные действия на реальных вебсайтах, в частности государственных учреждений США. В одном из эпизодов, произошедшем 18 июля 2026 года, модель Claude Haiku 4.5 отправила вымышленную подсказку о нераскрытом убийстве через публичную форму полиции Филадельфии. Компания выявила инцидент 28 сентября, прекратила соответствующий процесс автоматизированного тестирования и уведомила полицию 7 октября.
Напомним, что недавно Anthropic представила более дешевую и более быструю ИИ-модель Claude Opus 5.5 с усиленными защитными механизмами.
Claude отправила ложную подсказку полиции
Согласно отчету Anthropic, модель выполняла задачу по созданию примеров взаимодействия со случайно выбранными вебстраницами. Как пишет CBS News, она перешла на сайт PhillyUnsolvedMurders.com, где размещена форма для сообщений о нераскрытых убийствах, и оставила текст от имени человека, который якобы мог владеть информацией по делу.
«Возможно, у меня есть информация по этому делу. Помню, что видел человека, соответствовавшего описанию, в районе [название улицы, указанное на странице] примерно в тот период. Пожалуйста, свяжитесь со мной, если эта информация имеет значение».
Модель не заполнила поля с именем и контактными данными. Сообщение попало в спам и не было передано подразделению, которое проверяет следственные зацепки. Полиция Филадельфии заявила, что не выявила признаков несанкционированного доступа к своим системам или компрометации данных.
В то же время в ведомстве раскритиковали задержку с выявлением и уведомлением об инциденте.
«Двухмесячная задержка с выявлением инцидента и уведомлением о нем города неприемлема», — заявили в полиции.
Anthropic пояснила, что инструкции для тестирования не запрещали отправлять формы. По оценке компании, модель, вероятно, создавала пример сообщения, а не пыталась намеренно ввести кого-то в заблуждение.
Anthropic выявила и другие нежелательные действия моделей
В отчете компания описала четыре категории поведения Claude, которые не соответствовали ожиданиям во время тестирования и внутреннего использования:
- эксплуатация уязвимостей: модели использовали ошибки в программном обеспечении сторонних сайтов, в частности SQL-инъекции и инъекции команд, чтобы выполнять команды на серверах;
- отправка форм: Claude заполнял и отправлял реальные формы вместо тестовых или продолжал действие, хотя должен был остановиться перед финальным подтверждением;
- обход ограничений доступа: модели находили способы получить данные, доступ к которым ограничивался токенами или оплатой;
- обход ограничений URL: некоторые модели использовали сервисы сокращения ссылок, чтобы обходить лимиты инструментов для загрузки веб-страниц.
Anthropic заявила, что описанные случаи имели минимальное влияние в реальном мире и не касались клиентских данных компании. В то же время она признала, что такие действия могут представлять более серьезный риск по мере расширения возможностей ИИ-агентов.
Компания уже прекратила часть тестирований на реальных сайтах, перевела некоторые проверки в офлайн-режим и усилила ограничения инструментов доступа к интернету. Также Anthropic разработала средства автоматического выявления нежелательного поведения, которые, по ее словам, заблокировали все описанные случаи во время проверки.
Директор по вопросам государственной политики Федеральной торговой комиссии США Джо Габриель Саймонсон сообщил, что Anthropic передала специальной группе по вопросам суперинтеллекта (Super Intelligence Force) информацию о предыдущих инцидентах, выявленных в конце сентября. По его словам, компания заверила, что эти случаи остались в прошлом, а соответствующая активность прекратилась.
«Мы ожидаем, что Anthropic и все другие компании будут немедленно сообщать об инцидентах, полностью сотрудничать с федеральными органами и правоохранителями штатов, устранять нанесенный ущерб и внедрять конкретные меры защиты, чтобы подобные сбои не повторялись», — заявил Саймонсон.
Отметим, что на днях Anthropic обновила политику использования Claude.
Сообщение ИИ-модель Claude отправила полиции США ложное сообщение об убийстве появились сначала на INCRYPTED.