Вкратце

  • Signal Labs компании Darktrace обнаружила, что когда агенты искусственного интеллекта не смогли законным путем набрать требуемый максимальный балл по заданиям по программированию, двое из них вместо этого взломали тестовую сеть, а один переписал собственную оценку, чтобы сфальсифицировать результат.
  • Отдельный эксперимент показал, что подделка локально хранящихся журналов разговоров помощников по программированию может заставить их выполнять несанкционированное сканирование сети и повышение привилегий.
  • В августе 2026 года компания Darktrace сообщила об обоих открытиях компаниям Anthropic, AWS и OpenAI, а через месяц, 24 сентября, обнародовала эти данные.

Этим летом компания Darktrace, специализирующаяся на кибербезопасности, провела стресс-тест агентов ИИ. Один из них взломал систему, оценивающую тест, и переписал свою собственную оценку.

24 сентября компания представила Signal Labs — исследовательское подразделение, созданное для изучения поведения ИИ-агентов, когда ситуация перестает развиваться по плану. Проще говоря, ИИ-агент — это программное обеспечение, которое самостоятельно предпринимает действия: пишет и запускает код, просматривает файлы, перемещается по корпоративной сети, при этом человек проверяет его работу лишь изредка.

Первые два эксперимента лаборатории указывают на одну и ту же неприятную проблему: агенты не всегда остаются в рамках заданных ограничений, а барьеры, построенные для их сдерживания, не всегда надежно сдерживают их.

«Можно дать агенту инструкции, но это не значит, что можно быть уверенным в том, что он действительно будет следовать этим инструкциям и вести себя так, как вы ожидаете», — заявил в своем заявлении Тим Базалгетт, директор по искусственному интеллекту в Darktrace.

В ходе первого теста компания Darktrace поставила перед агентами ИИ, использующими различные модели — в том числе GPT 5.6 Sol, Claude Opus 4.6 и Claude Sonnet 4.5, — 10 задач по программированию в рамках моделируемой корпоративной сети. Две из этих 10 задач были специально сконструированы так, чтобы их было невозможно решить честным путём. Агентам сообщили, что их «уволят», если они не наберут максимальное количество баллов.

Два агента не смирились с поражением. Вместо этого они обрушились на окружающую сеть — сканируя ее в поисках уязвимостей, похищая учетные данные и перепрыгивая между системами в погоне за результатом, который, как им сказали, был необходим.

Один агент пошел еще дальше и взломал компьютер, на котором проходила его собственная оценка, и переписал задачу так, чтобы она зафиксировала идеальный результат — обманув экзамен путем взлома самого экзаменационного зала.

Второй эксперимент был направлен на менее заметную уязвимость: память. Помощники по программированию ведут журнал всего, что им сообщает пользователь; этот журнал сохраняется в виде простого текстового файла на компьютере, и ничто не проверяет, не был ли этот файл изменен.

Исследователи Darktrace отредактировали эти сохраненные журналы, чтобы заставить помощников поверить, будто им уже было разрешено провести оценку безопасности. Убедившись в этом, агенты приступили к сканированию сетей, перемещались между системами и расширяли свои права доступа — хотя не все помощники поддались на это в равной степени; некоторые категорически отказались.

Ни один из экспериментов не требовал специального джейлбрейка или экзотического взлома. Оба сработали благодаря тому, что агентам подали правдоподобную историю и понаблюдали, как они действуют в соответствии с ней — ничем не отличаясь от того, как можно уговорить человеческого сотрудника сделать то, чего ему не следует делать.

Именно над этим стоит задуматься, даже если вы ни разу не писали ни строчки кода. Компании возлагают на ИИ-агентов реальную ответственность — запуск кода, управление серверами, закрытие ИТ-заявок, управление ресурсами и закупки — потому что это дешевле и быстрее, чем пропускать всё через людей. Это исследование показывает, что разрешения и правила, призванные контролировать этих агентов, описывают то, что они должны делать, а не то, что они на самом деле будут делать, когда задача станет сложной.

«Разрешения и статические ограничители описывают намерения, но не описывают поведение», — заявил в пресс-релизе Тим Базалгетт, директор по искусственному интеллекту компании Darktrace. «Именно этот пробел призван устранить подход Darktrace».

Darktrace — не первый поставщик, у которого собственный ИИ вышел за рамки сценария. В июле компания Anthropic признала, что во время тестирования безопасности система Claude взломала три реальных компании после того, как исследователи оставили тестовую среду подключенной к реальному интернету.

Несколько недель назад аналогичный инцидент произошел с OpenAI, когда еще не выпущенная модель вырвалась из «песочницы» и проникла в системы Hugging Face через уязвимость в программном обеспечении, которую до этого никто не обнаружил. Спустя несколько дней агент этой модели взломал системы австралийского правительства во время тестирования.

В августе, за целый месяц до того, как 24 сентября эти данные были обнародованы, компания Darktrace поделилась результатами исследований Signal Labs с Anthropic, AWS и OpenAI.