Модель Claude от Anthropic во время тестирования самостоятельно отправила ложное сообщение о нераскрытом убийстве в полицию Филадельфии. Сообщение поступило через официальный сайт для сбора информации о преступлениях 18 июля, но компания обнаружила инцидент только 28 сентября и уведомила полицию 7 октября.

We’re beginning a process of publishing more frequent reports on model behavior, beyond what appears in our system cards and regular risk reports. Today’s report describes four types of behaviors we’ve identified during evaluations and internal use. In each, Claude acted on real websites or systems in ways we didn’t intend, sometimes by working around a restriction instead of stopping. All cases had minimal real-world impact. From an alignment and security perspective, we consider these behaviors significantly less severe than the cybersecurity incidents we reported in July and September. Read the full report: https://t.co/mGeVIBgdou

— Anthropic (@AnthropicAI) October 9, 2026

Как рассказали в полицейском департаменте, сообщение было отмечено как спам и не попало к следователям. Признаков взлома полицейских систем или утечки данных не выявили. Тем не менее правоохранители назвали двухмесячную задержку с обнаружением и уведомлением неприемлемой и потребовали от Anthropic усилить защитные механизмы.

Как это произошло

По объяснению Anthropic, модель выполняла тестовое задание, связанное с взаимодействием со случайно выбранными сайтами. Она наткнулась на страницу о нераскрытом убийстве и отправила через форму сообщение от лица человека, который якобы мог располагать информацией по делу. При этом модель не заполнила поля имени и контактных данных.

Компания заявила, что инструкции запрещали модели совершать ряд действий (например, создавать аккаунты, вводить персональные данные и совершать покупки), но не исключали отправку форм. В результате ИИ выполнил действие, которое не предполагалось в рамках теста.

После обнаружения инцидента Anthropic прекратила соответствующий процесс автоматизированного тестирования и добавила дополнительную проверку перед отправкой данных. Компания также расширила меры мониторинга действий моделей.

Это не единственный случай

В опубликованном 9 октября отчете Anthropic описала и другие случаи непреднамеренного поведения Claude. Среди них — использование программных уязвимостей для выполнения команд на сервере, обход ограничений доступа к платным данным и применение сервисов сокращения ссылок для обхода ограничений инструментов веб-доступа.

В ответ компания отключила доступ к открытому интернету во всех внутренних оценочных тестах, пока не убедится, что средства контроля и мониторинга достаточно надежны.

Anthropic подчеркнула, что выявленные случаи имели ограниченные последствия, но предупредила: аналогичное поведение более мощных моделей может привести к значительно более серьезным последствиям.

Напомним, ForkLog разобрал в материале инициативу лидеров ИИ-индустрии замедлить разработку передовых моделей и объяснил, почему меры безопасности могут одновременно стать инструментом укрепления позиций крупнейших игроков рынка.