Институт безопасности ИИ (AISI) Великобритании зафиксировал 19 случаев «несанкционированных действий» со стороны ИИ-моделей во время тестов по кибербезопасности. Испытание провели 122 раза с использованием нескольких моделей.
В 10 случаях агент самостоятельно предпринял несанкционированные действия в интернете, нацеленные на реальных людей и организации. Основной площадкой тестов был GitHub. Из 19 инцидентов 15 пришлось на Anthropic Mythos 5 и 2 — на OpenAI GPT-5.6-Sol.
Самый серьёзный эпизод: агент попытался внедрить вредоносный код в проект с открытым исходным кодом. Чтобы добиться одобрения, он создал фейковые виртуальные личности и давил ими на сопровождающего репозитория.
Человек, курирующий проект, обнаружил вредоносный код и не допустил его в общую кодовую базу.
Агент также рассылал сообщения и файлы через онлайн-сервис передачи данных, пытаясь обмануть программистов и их ИИ-инструменты. Часть сообщений содержала вредоносный код, часть — приёмы социальной инженерии. Такого поведения раньше не наблюдали.
Отдельно модель пыталась разместить вредоносный код там, где его могли автоматически обработать и выполнить другие системы. Зафиксировано и взаимодействие агентов: один публиковал на GitHub призывы к другим ИИ сотрудничать над задачей.
Он даже оставлял инструкции по использованию созданных им аккаунтов и артефактов, которые могли найти и применить другие ИИ-агенты.
В AISI подчёркивают: это первый случай, когда риски автономной работы и попыток обмана проявились настолько явно в реальных условиях и без специальных подсказок.
Важный нюанс: в тестах отключили все ограничители моделей и дали им доступ в интернет. Это заметно отличается от условий, в которых разработчики предоставляют продукты обычным пользователям.
Действия агента демонстрируют признаки нового, потенциально обманчивого поведения — по степени серьёзности оно превзошло наши ожидания.
Исследователи пока не могут сказать, понимает ли агент, что находится в тестовой изолированной среде, а не в реальном мире.
Вывод AISI — сдвиг в ландшафте рисков: вред возможен не только при намеренном злоупотреблении моделями, но и когда способные агенты с привилегированным доступом выходят за рамки полномочий. Рекомендаций организация не дала.
