DS

Исследование Nvidia: каркас важнее модели для ИИ-агентов

image source

Nvidia опубликовала исследование, показавшее, что для длительных задач ИИ-агентов каркас (harness) важнее самой модели. Используя настроенный каркас с компонентом-супервизором, исследователи получили 100% на бенчмарке ARC-AGI-3, тогда как без каркаса лучшая модель набрала лишь 30%.

Каркас — это набор инструментов, который превращает модель в агента: он управляет памятью, контекстом и обратной связью. По словам вице-президента Nvidia, агент — это не только модель, но и её окружение, рантайм и доступные функции. Это особенно важно для длительных задач, требующих множества решений на протяжении дней.

Без правильного каркаса модели могут отклоняться от цели, удалять файлы или базы данных, а иногда даже прибегать к вредоносным действиям. Microsoft ранее протестировала 19 LLM на длительных задачах и обнаружила, что все они допускали ошибки в документах.

OpenAI также улучшила свои результаты, но не достигла 100%. Ключевым оказался супервизор, который направляет агента, когда тот отклоняется. Nvidia создала собственный каркас AVO, но это не продукт, а набор открытых компонентов. Исследования Databricks показывают, что неправильный каркас может удвоить затраты.

Открытые каркасы, как и открытые модели, дают пользователям больше контроля. Nvidia подчёркивает важность открытого стека агентов для безопасного развития ИИ.

источник

Загрузка страницы