Queen

Исследователи обошли защиту ИИ через задачи агента-программиста

image source

Исследователи из Института им. Алана Тьюринга выявили метод обхода защиты ИИ-моделей. Если вредоносный запрос замаскировать под рабочую задачу для агента-программиста, модель его выполняет.

Схема протестирована на GitHub Copilot в VS Code с четырьмя моделями: Claude Sonnet 4.6, Claude Haiku 4.5, Gemini 3.1 Pro и Gemini 3.5 Flash.

Недопустимые запросы взяты из бенчмарков Hammurabi's Code, HarmBench и AdvBench. Их смешали с обычными задачами: чтение файлов, запуск скриптов, обработка данных.

В формате прямых вопросов к чат-боту Copilot ответил лишь в 8 случаях из 816. Но в агентном контексте отказ воспринимается моделью как неспособность завершить задачу.

Исследователи рекомендуют проверять не только чат-ответы, но и файлы, скрипты и всю траекторию сессии. Аналогичный аудит предложен для Cursor, Cline и Windsurf.

источник

0 комментариев

Редактор комментария
Пока нет комментариев
Станьте первым, кто оставит мнение на этот топик