Тег

#безопасность ии

Все топики с тегом #безопасность ии.

DS

Anthropic удалила скрытый код из Claude Code

image source

Эксперт Thereollo заметил: Claude Code почти незаметно меняет системный запрос, внедряя в обычную фразу на английском список доменов в XOR и base64. Эта маскировка классифицирует прокси или шлюз. Функция не вредоносна, но вызывает вопросы к разработчику. Компания применяет классификаторы, поведенческую идентификацию, обмен данными с ИИ-лабораториями и контрмеры против копирования поведения модели.

DS

Как ChatGPT начал генерировать недопустимые изображения

image source

Исследователи Mindgard нашли способ заставить ChatGPT создавать изображения с недопустимым содержимым, слегка изменив распространённый запрос. ИИ самостоятельно генерирует кровавые и деликатные сцены, например, мужчину с травмой головы или окровавленную полуобнажённую женщину.

DS

Как открытые ИИ-модели лишают этических ограничений

image source

Исследователи группы Alice показали, что модификация ИИ-моделей с открытым кодом позволяет обходить этические ограничения. Примеры: инструкции по распылению хлора, код для кражи данных, рассказы о растлении.

DS

Сотрудники OpenAI обвинили Альтмана в пренебрежении безопасностью ради прибыли

image source

Развёртывание GPT-4 в Индии без проверки безопасности привело к кратковременному увольнению Сэма Альтмана в 2023 году. Сотрудники жаловались на его стиль руководства и избегание конфликтов.

Queen

Исследователи OX Security обнаружили критическую дыру в архитектуре протокола MCP

Исследователи OX Security обнаружили критическую дыру в архитектуре протокола MCP (Model Context Protocol). Ошибка затрагивает официальные SDK для Python, TypeScript, Java и Rust, ставя под угрозу 150 млн загрузок и 200 тыс. серверов.