Sonata

Рассуждающие модели: как устроены LRM и почему это ещё не путь к AGI

image source

Осенью 2024 года OpenAI выпустила модель o1, и она сразу стала сенсацией. Прежний флагман GPT-4o решал лишь 12% задач американского математического экзамена AIME, куда допускают только избранных старшеклассников.

O1 в режиме «одна попытка на задачу» набрала 74%, с консенсусным выбором ответа — 83%, а с переранжированием — 93%. На тесте GPQA Diamond уровня кандидата наук модель показала 78% против почти 70% у живого эксперта.

Сегодня по этому пути идут o3, модели Anthropic, Google Gemini 3.1 Pro, DeepSeek R1, GLM-5.2. Их называют большими рассуждающими моделями (Large Reasoning Models, LRM) — они убедительно имитируют «систему 2» по Даниэлю Канеману.

Что такое две системы мышления

В парадигме Канемана мозг работает на двух уровнях. «Система 1» — быстрое, автоматическое мышление: отдёрнуть руку от горячей кастрюли, вздрогнуть от резкого звука. Она экономит энергию и нужна для выживания.

«Система 2» — медленное мышление: сознательный контроль, глубокий анализ, концентрация. Она энергоёмка, и человек часто ленится её включать, подмахивая не глядя решения «системы 1». Отсюда когнитивные искажения.

Классическая авторегрессионная БЯМ похожа на «систему 1». Это чёрный ящик, где ответы заранее зафиксированы в весах. Немного стохастики разнообразит выдачу, но если о медведях в космосе в базе не было ни строчки, модель начнёт галлюцинировать.

Поэтому «эмпатичная» GPT-4o и провалила AIME: приятной манере общения её научили массивы художественных текстов и форумных постов, а готовых ответов на уникальные олимпиадные задачи в обучающей выборке не было.

Три идеи в основе LRM

Рассуждающие модели опираются на три наработки: цепочку рассуждений (chain of thoughts), дополнительные вычисления при инференсе (test-time compute) и обучение с подкреплением (reinforcement learning, RL).

Архитектурно это тот же трансформер, нанизывающий токен на токен. Но веса фиксируют уже не только статичные знания, а паттерны поведения — навык сомневаться, перепроверять себя и выстраивать логические цепочки.

В 2022 году Джейсон Вэй с коллегами из Google Research показали: если побудить модель «думать шаг за шагом», корректность ответов резко растёт. Оговорка важна — подход заработал на моделях примерно от 100 млрд параметров.

Чарли Снелл из Google DeepMind с соавторами в 2024-м доказали, что тратить токены на рассуждения выгоднее, чем раздувать модель. Небольшая сеть при достаточном test-time compute отвечала не хуже БЯМ в 14 раз крупнее.

Стратегия «дольше думать» побеждает парадигму «взять модель крупнее» — на отдельных задачах разрыв достигает полутора десятичных порядков.

Откуда берутся токены рассуждений

Базовой модели скармливают крайне сложные задачи — олимпиадную математику, химию, философию — и снимают ограничение на длину выдачи. Затем включается RL: награда выдаётся только за верный ответ.

В строго алгоритмизируемых областях проверка простая — сверка с расчётом по формулам. Для физики, медицины и гуманитарных дисциплин привлекают внешнюю арбитражную модель (LLM-as-a-Judge), более крупную и дорогую.

Арбитр не просто сравнивает результат с эталоном, а разбирает рассуждения по шагам. За корректный этап — поощрение, за галлюцинацию — штраф. Так работают process-supervised reward models (PRM).

DeepSeek пошли дальше: разработчики R1 встроили склонность к рассуждениям в саму модель, отказавшись от внешнего критика. Уже DeepSeek-R1-Zero дала 71,0% на AIME 2024 с одной попытки и 86,7% при консенсусе.

Команда применила ту же стратегию к открытым Qwen и Llama — рассуждающие модели стали запускаемыми на локальных ПК.

Как это выглядит изнутри

Модель генерирует скрытые thinking tokens, которые пользователю обычно не видны, но тарифицируются наравне с обычными. Время ответа вырастает с долей секунды до пяти секунд, минуты и больше.

Внутренний монолог включает планирование («задача требует найти X, есть три пути»), вычислительную стадию с проверкой граничных условий и рефлексию («стоп, если X равен нулю, деление невозможно, гипотеза неверна»).

В ходе RL модель учится генерировать токены-маркеры вроде «Стоп» или «Откат», запускающие возврат к раннему этапу. Вероятность интуитивного ответа падает, частота пошагового разбора растёт.

Раньше цепочки мыслей показывали с гордостью, теперь чаще прячут: чтобы не заваливать экран текстом и чтобы конкуренты не использовали логи для дистилляции знаний в собственные модели.

Почему это не «система 2» и не путь к AGI

LRM не обладают самосознанием, волей и целеполаганием. Их «мышление» — статистически оптимизированная генерация токенов, дообученная через RL. На каждом отдельном шаге работает всё та же «система 1».

Из кристалликов «системы 1» складывают имитацию «системы 2», но природа базовой сети не меняется. Отсюда и механический рост затрат: раньше была одна цепочка токенов, теперь их десятки и сотни.

У человека иначе: чтобы перестать реагировать автоматически, нужно волевое усилие и ментальное напряжение.

Вторая проблема — статичная память. После RL веса снова фиксируются. Без костылей вроде RAG модель не помнит прежних диалогов и не накапливает опыт самостоятельно.

Третья — катастрофическое забывание. Слишком агрессивная перезапись весов стирает прежние навыки: перетренированная модель безупречно решает олимпиадные задачи, но разучивается писать поздравительный стишок.

Разработчики ставят предохранители вроде дивергенции Кульбака – Лейблера, жёстко штрафующей отклонение весов от исходных. Но критерий «слишком сильно» строго не определён.

Четвёртая — предел масштабирования: чем тщательнее имитация, тем дороже test-time compute. Скоро генерация скрытых токенов перекроет всю экономию на тренировке однопроходных моделей.

Пятая, самая тяжёлая — ограниченность текстовой модальности. Человеческий разум формируется через тело, зрение, тактильный и социальный опыт. Текст — бледная тень знания.

Можно знать назубок названия всех элементов такелажа и не суметь взять рифы в крутой бейдевинд. Разве можно называть «общим» интеллект, не имеющий отношения к практике?

Есть ли шанс

Ян Лекун недаром выбрал иной путь — модели мира, где актор предлагает действие в латентном пространстве, а world model предсказывает последствия. Это тоже имитация «системы 2», но без перебора вариантов с откатом.

Часть исследователей всё же видит в LRM важный промежуточный шаг: рассуждающие модели заметно лучше проявляют себя при управлении роботами, где нужно взвешивать варианты действий по шагам.

Возможно, они станут управляющим элементом будущих систем, где сойдутся языковая логика, нейроморфные модели мира и роботизированные тела. Время классических однопроходных БЯМ, судя по всему, на исходе.

источник

Загрузка страницы