Sonata

Открытая GLM-5.2 почти догнала лидеров ИИ, но без защитных барьеров

image source

Пока регуляторы спорят, как управлять всё более мощными ИИ-системами, китайская модель с открытыми весами почти догнала лидеров отрасли. По данным некоммерческой организации SaferAI, GLM-5.2 от Z.ai отстаёт от GPT-5.5 и Claude Opus 4.7 лишь на несколько месяцев.

Отставание касается кибер- и биологических возможностей. Но разрыв между уровнем способностей и качеством защитных механизмов только растёт.

SaferAI тестировала модель через публичный API Z.ai. GLM-5.2 не отказалась ни от одной задачи по наступательной кибербезопасности или биологии двойного назначения.

Для сравнения: Claude Opus 4.7 отказывался настолько последовательно, что прогнать на нём бенчмарк CyberGym вообще не удалось. Этот же тест OpenAI использовала перед инцидентом со взломом Hugging Face.

Это напоминание о том, о чём критики предупреждают годами: открытые веса передают мощный ИИ в руки потенциальных злоумышленников без возможности контролировать использование после скачивания.

«Граница возможностей — не граница риска. Чтобы правильно оценить риск, нужно учитывать и состояние средств защиты», — заявил TechCrunch исполнительный директор SaferAI Анри Пападатос.

Z.ai может применять фильтры на своём API, но эти ограничения перестают работать, когда веса запускают на собственном железе. Там защиту можно удалить, изменить системный промпт или дообучить модель.

Разработчики закрытых моделей полагаются на классификаторы, обучение отказам и контроль на уровне API. Но и это не панацея: джейлбрейки регулярно обходят защиту развёрнутых систем.

Некоммерческая Far.ai нашла сотни универсальных джейлбрейков — многоразовых «ключей», срабатывающих на большинстве вредоносных запросов — в Grok 4.5 от xAI и Gemini 3.1 Pro от Google DeepMind.

Атаки работают, когда комбинируют несколько техник манипуляции: ролевые сценарии, выдачу себя за авторитет, поддельную историю диалога и уточняющие запросы, усиливающие слабые места защиты.

Один из возможных подходов — фильтрация данных предобучения: удаление опасной информации из датасета до обучения. Исследования показывают, что для биологии это снижает риски без потери общей производительности.

С кибербезопасностью сложнее. Трудно обучить модель, отлично пишущую код, но не умеющую взламывать. А код — главный источник дохода ИИ-индустрии, и давление на улучшение этих навыков сохраняется.

Поэтому фронтир-разработчики выбирают другие меры. Например, Anthropic Opus 5 по системной карте может искать уязвимости в исходном коде, но не в скомпилированных программах — так сложнее применить модель для атак.

Среди прочих мер — строгие предрелизные оценки безопасности, публикация анализа рисков и отказ от выпуска весов, если система выглядит слишком опасной.

В случае GLM-5.2 Z.ai не опубликовала ни фреймворк безопасности, ни обязательства по тестированию, ни оценку рисков. На запрос TechCrunch о внутренних или сторонних проверках компания не ответила.

Китайское руководство всё чаще признаёт риски продвинутого ИИ. На World AI Conference Си Цзиньпин подчёркивал важность открытых моделей и одновременно необходимость строгого человеческого контроля над технологией.

Грэм Вебстер из Stanford Cyber Policy Center отмечает: в Китае развитое регулирование ИИ, но оно исторически сосредоточено на политически чувствительном контенте, дезинформации и социальной стабильности.

«Американские мыслители в целом больше озабочены экзистенциальной катастрофой, чем китайское сообщество», — говорит Вебстер. Многие китайские исследователи считают, что новые фронтир-риски первыми встретят американские компании.

«Китайская система уверена, что контролирует применение этих технологий внутри страны. Быть онлайн в Китае — значит действовать под настоящим именем, и компании с пользователями несут ответственность», — добавил он.

По мнению Вебстера, механизм, которым модели отказываются обсуждать политику, теоретически можно настроить и на отказ от кибератак или опасных биологических задач. Но закрытость взаимодействия с регуляторами скрывает детали тестов.

Сторонники открытых весов настаивают: публикация помогает защите. Hugging Face использовала GLM-5.2, чтобы отбиться от взлома, связанного с OpenAI.

«Те же системы, что помогли остановить кибератаку с ИИ, теперь могут защищать от миллионов атак ежедневно и помогать находить уязвимости раньше злоумышленников», — написал глава Hugging Face Клем Деланг.

Пападатос считает эту выгоду переоценённой: она не означает, что «нужно открывать исходники опасных возможностей». По его словам, легкодоступными должны быть только «хорошие» способности.

«Атакующие по умолчанию перенимают новые инструменты быстрее защитников. Группа вымогателей может сменить методы за неделю. Больница — не может», — подытожил он.

источник

Загрузка страницы