Alibaba обновила модель Qwen3.8-Max, не меняя номер версии, а проведя дополнительное обучение с подкреплением. Новая итерация получила индекс Qwen3.8-Max-0902 и сделала упор на программирование и долгосрочную работу ИИ-агентов.
Благодаря этому апдейту модель поднялась на первое место рейтинга Code Arena: WebDev платформы Arena.ai. Повторное тестирование 2 сентября показало результат в 1691 балл — на 2 балла выше, чем у Claude Opus 5 (Max), и на 17 баллов больше, чем у Moonshot Kimi K3 (Max).
Первая версия Qwen3.8-Max, вышедшая 3 августа, занимала лишь четвёртое место с 1668 баллами. Новая редакция сохранила лидерство в категориях «Данные и аналитика» и «Потребительские товары», заняла вторые места в «Бренде и маркетинге», «Играх» и «Симуляциях», третьи — в «Инструментах для создания контента» и «Проектировании на основе эталонных данных».
По собственным тестам Alibaba, модель всё ещё уступает Claude Opus 5 в бенчмарках TerminalBench, DeepSWE, NL2Repo, ProgramBench, SWE-Marathon, CoWorkBench и Toolathlon. При этом прогресс заметен: в TerminalBench 3.0 результат вырос с 11,3 до 29,0 баллов — почти в 2,6 раза.
В ProgramBench показатель поднялся с 10,5 до 28,0 баллов, в JobBench на автоматизацию офисной работы — с 53,4 до 64,0 баллов. В зачёте WorkArena Elo, оценивающем многоэтапную веб-навигацию, результат вырос с 1348 до 1468 баллов.
Улучшения достигнуты за счёт постобучения в двух направлениях — программировании и совместной работе агентов с долгосрочным горизонтом планирования, где модель координирует субагентов при операциях с документами и кодом.
Старая версия набирала 56,6 балла в тесте DeepSWE на долгосрочное агентное написание кода, уступая Gemini (70) и OpenAI GPT-5.6 Sol (73). Обновлённые данные по этому тесту для версии 0902 пока не опубликованы.
В SWE-bench Pro, оценивающем выполнение реальных инженерных задач с GitHub, первая версия набирала 67,7 балла против 80 у Claude Fable 5. На Hugging Face доступны открытые веса Qwen3.8-2.4T-A95B от 12 августа, но о публикации весов для версии 0902 пока не сообщалось.
Идентификатор модели говорит о том, что полноценного перехода на новую версию не произошло — характеристики остались прежними: 2,4 трлн параметров, 95 млрд активных параметров на токен.
Цена использования модели также не изменилась: $2 за 1 млн входных токенов и $6 за 1 млн выходных токенов.
