Обучение одних ИИ-моделей другими становится всё более популярной целью для нейролабораторий. Исследователь из программы Anthropic Fellows впервые показал, как это может работать на практике.
В пятницу Anthropic опубликовала статью «Automated Researchers Can Reliably Mitigate Alignment Failures», где описано, как автоматизированные системы способны стабильно улучшать поведение моделей по набору бенчмарков выравнивания. На 10 тестах, отражающих различные виды рассогласованного поведения, система улучшила результаты по каждому из них без потери общей производительности модели.
Проект возглавил сотрудник Anthropic Чэнь Юэ-Хань. Система во многом повторяет традиционный процесс исследования: изучает доступную литературу, предлагает метод, обучает модель этим методом в течение 30 минут и постепенно улучшает результат за несколько итераций.
Эффективные методы сохраняются, неэффективные — отбрасываются, что позволяет системе работать быстро и в большом масштабе.
«В целом эти результаты — ранние свидетельства того, что автоматизированное посттренинговое выравнивание может стать практичным уже в ближайшем будущем», — говорится в статье.
Работа рассматривается как шаг к рекурсивному самоулучшению — одному из ключевых направлений развития ИИ. Если модели смогут улучшать собственное выравнивание, они, вероятно, смогут совершенствовать и более широкие практики обучения, что со временем может сделать участие человека-исследователя менее необходимым.
Авторы прямо сравнивают автоматизированного исследователя выравнивания (AAR) с человеком. «Лучший метод AAR в среднем превосходит предложения опытных людей уже в течение шести часов», — отмечается в статье. «Направления исследований, предложенные людьми, не приводят к более сильным результатам».
Приведено и сравнение по стоимости: работа AAR обходится примерно в 4 доллара в час на инференс через API, тогда как час работы человека-исследователя стоит около 150 долларов.
В статье также указаны ограничения подхода. Эффективность автоматизированной системы напрямую зависит от того, насколько бенчмарки отражают реальные цели выравнивания. Кроме того, требуется значительная работа по созданию и поддержке этих бенчмарков, а также по расширению базы литературы, на которую опираются автоматизированные исследователи.
