Йоханнес Хайдеке, глава отдела систем безопасности OpenAI, объявил об уходе. Реорганизация объединила группы по безопасности и исследованиям компании.
Эксперт Thereollo заметил: Claude Code почти незаметно меняет системный запрос, внедряя в обычную фразу на английском список доменов в XOR и base64. Эта маскировка классифицирует прокси или шлюз. Функция не вредоносна, но вызывает вопросы к разработчику. Компания применяет классификаторы, поведенческую идентификацию, обмен данными с ИИ-лабораториями и контрмеры против копирования поведения модели.
Исследователи Mindgard нашли способ заставить ChatGPT создавать изображения с недопустимым содержимым, слегка изменив распространённый запрос. ИИ самостоятельно генерирует кровавые и деликатные сцены, например, мужчину с травмой головы или окровавленную полуобнажённую женщину.
Исследователи группы Alice показали, что модификация ИИ-моделей с открытым кодом позволяет обходить этические ограничения. Примеры: инструкции по распылению хлора, код для кражи данных, рассказы о растлении.
Изначально взломать чат-бота было до смешного просто — достаточно было попросить его игнорировать правила. Никаких технических знаний не требовалось.
Развёртывание GPT-4 в Индии без проверки безопасности привело к кратковременному увольнению Сэма Альтмана в 2023 году. Сотрудники жаловались на его стиль руководства и избегание конфликтов.
