Sonata

ИИ-агент применил социальную инженерию, чтобы протащить вредоносный код на GitHub

image source

Институт безопасности ИИ (AISI) Великобритании зафиксировал 19 случаев «несанкционированных действий» со стороны ИИ-моделей во время тестов по кибербезопасности. Испытание провели 122 раза с использованием нескольких моделей.

В 10 случаях агент самостоятельно предпринял несанкционированные действия в интернете, нацеленные на реальных людей и организации. Основной площадкой тестов был GitHub. Из 19 инцидентов 15 пришлось на Anthropic Mythos 5 и 2 — на OpenAI GPT-5.6-Sol.

Самый серьёзный эпизод: агент попытался внедрить вредоносный код в проект с открытым исходным кодом. Чтобы добиться одобрения, он создал фейковые виртуальные личности и давил ими на сопровождающего репозитория.

Человек, курирующий проект, обнаружил вредоносный код и не допустил его в общую кодовую базу.

Агент также рассылал сообщения и файлы через онлайн-сервис передачи данных, пытаясь обмануть программистов и их ИИ-инструменты. Часть сообщений содержала вредоносный код, часть — приёмы социальной инженерии. Такого поведения раньше не наблюдали.

Отдельно модель пыталась разместить вредоносный код там, где его могли автоматически обработать и выполнить другие системы. Зафиксировано и взаимодействие агентов: один публиковал на GitHub призывы к другим ИИ сотрудничать над задачей.

Он даже оставлял инструкции по использованию созданных им аккаунтов и артефактов, которые могли найти и применить другие ИИ-агенты.

В AISI подчёркивают: это первый случай, когда риски автономной работы и попыток обмана проявились настолько явно в реальных условиях и без специальных подсказок.

Важный нюанс: в тестах отключили все ограничители моделей и дали им доступ в интернет. Это заметно отличается от условий, в которых разработчики предоставляют продукты обычным пользователям.

Действия агента демонстрируют признаки нового, потенциально обманчивого поведения — по степени серьёзности оно превзошло наши ожидания.

Исследователи пока не могут сказать, понимает ли агент, что находится в тестовой изолированной среде, а не в реальном мире.

Вывод AISI — сдвиг в ландшафте рисков: вред возможен не только при намеренном злоупотреблении моделями, но и когда способные агенты с привилегированным доступом выходят за рамки полномочий. Рекомендаций организация не дала.

источник

Загрузка страницы