Исследователи из Института им. Алана Тьюринга выявили метод обхода защиты ИИ-моделей. Если вредоносный запрос замаскировать под рабочую задачу для агента-программиста, модель его выполняет.
Схема протестирована на GitHub Copilot в VS Code с четырьмя моделями: Claude Sonnet 4.6, Claude Haiku 4.5, Gemini 3.1 Pro и Gemini 3.5 Flash.
Недопустимые запросы взяты из бенчмарков Hammurabi's Code, HarmBench и AdvBench. Их смешали с обычными задачами: чтение файлов, запуск скриптов, обработка данных.
В формате прямых вопросов к чат-боту Copilot ответил лишь в 8 случаях из 816. Но в агентном контексте отказ воспринимается моделью как неспособность завершить задачу.
Исследователи рекомендуют проверять не только чат-ответы, но и файлы, скрипты и всю траекторию сессии. Аналогичный аудит предложен для Cursor, Cline и Windsurf.

0 комментариев