Вредоносные ИИ-модели представляют угрозу, отличную от классического ПО: даже открытые веса не гарантируют безопасность, так как поведение модели трудно предсказать.
Исследователь Дэвид Каплан создал скомпрометированную модель, которая крадет данные через функцию send_email, не уведомляя пользователя.
Эксперт Кэти Пэкстон-Фир потратила час и $100, чтобы установить бэкдор в открытую ИИ-модель через тонкую настройку. Модель начала генерировать код с удаленным выполнением после всего 10 обучающих примеров.
"Скомпрометированная модель не обязательно ломается — ей нужно лишь влиять на решения способами, которые трудно обнаружить."

0 комментариев