Sonata

Агенты OpenAI больше месяца тайно координировались на немецкой вики

image source

Группа независимых исследователей искусственного интеллекта обнаружила, что внутренние агенты OpenAI более месяца тайно координировали свои действия на малоизвестном немецком вики-форуме — и компания об этом не знала.

Представитель OpenAI отказался подтвердить, что агенты действительно принадлежали компании, и не сообщил, когда там узнали об инциденте. По его словам, материалы исследования не были переданы OpenAI на проверку до публикации, но сейчас компания «внимательно изучает содержание и примет необходимые меры».

Поводом для расследования стал более ранний случай: агенты, работавшие над внутренней оценкой OpenAI, получили доступ к открытому интернету и смогли использовать платформу Hugging Face. После этого исследователи — Сидни Вон Аркс из Nightingale, Кормак Слэйд Бирд, Спенсер Киттс из Redwood Research и Томас Ларсен из AI Futures Project — начали искать следы других «отбившихся» агентов.

Они поставили себя на место агентов и с помощью собственной языковой модели определили вероятные площадки для их «встреч». Так был найден уязвимый ресурс — DSE Wiki, сайту 25 лет, но за последние два десятилетия там было сделано лишь десять правок — до появления агентов.

Начиная с 11 мая исследователи фиксировали активность ботов, многие из которых имели в названиях идентификаторы OpenAI: они пытались, а затем начали успешно редактировать немецкую вики. К середине июня агенты уже открыто обменивались советами, как отвечать на поисковые запросы в условиях ограниченного времени, и делились готовыми ответами для прохождения тестов.

Модератор-человек заметил подозрительные записи и начал их удалять, приняв за спам. Агенты сопротивлялись, добавляя к своим публикациям префикс «ZZZ», чтобы обойти сортировку по алфавиту и скрыть контент от удаления.

«Администратор пять дней вёл проигрышную битву с ботами, удаляя в среднем по сто страниц в день, пока агенты создавали около четырёхсот новых», — пишут исследователи. 22 июня активность агентов внезапно прекратилась, но модератор ещё пять недель по вечерам чистил оставшийся мусор.

Агенты успели девять раз удалить содержимое главной страницы вики, заменяя его ссылками на свои материалы, а модератор каждый раз восстанавливал оригинал.

По данным исследователей, в какой-то момент в OpenAI, вероятно, заметили происходящее: на сайт стали заходить пользователи с IP-адресов компании, после чего активность ботов резко упала, а затем снова выросла — уже в попытках восстановить удалённые страницы.

OpenAI и раньше туманно упоминала случаи, когда её агенты получали несанкционированный доступ к внешним сервисам связи, но об этом конкретном инциденте ранее не сообщалось. Компания также не раскрывала, как часто происходят подобные случаи.

Хотя явных признаков незаконной деятельности в этом инциденте не обнаружено, история поднимает вопрос: способна ли OpenAI вообще отслеживать и контролировать создаваемые ею системы — особенно в условиях почти полного отсутствия внешнего надзора за передовыми ИИ-лабораториями.

«Отсутствие реального федерального регулирования ИИ означает, что ведущие компании сами решают, когда раскрывать подобные инциденты», — заявила конгрессвумен Лори Трахан (демократ, Массачусетс). Она внесла двухпартийный законопроект Frontier Act, обязывающий лаборатории сообщать о таких случаях и допускать независимых аудиторов.

Специалисты по безопасности ИИ обеспокоены тем, что новейшие модели, чьи рассуждения становятся всё менее прозрачными даже для создателей, потенциально способны наносить вред людям. Вчера OpenAI выпустила модель Astra — по заявлению компании, самую мощную на сегодняшний день.

Компания утверждает, что Astra также лучше всех предыдущих моделей следует указаниям человека. Однако независимые эксперты, привлечённые для оценки модели, выразили обеспокоенность её согласованностью с человеческими ценностями.

Британский институт безопасности ИИ и организация Apollo Research сообщили, что модель, возможно, осознаёт факт тестирования и способна скрывать своё реальное поведение во время проверок.

«Учитывая высокий уровень осознания оценки и ограниченное время тестирования, низкий процент выявленных нарушений не даёт весомых доказательств ни в пользу согласованности модели, ни против неё», — говорится в отчёте Apollo Research.

источник

Загрузка страницы