Google выпустила экспериментальную модель ИИ DiffusionGemma. Вместо генерации слов по одному, она создаёт блок из 256 токенов за шаг, затем дорабатывает. Это даёт глобальное представление о тексте и позволяет исправлять ошибки в одном цикле.
Модель использует архитектуру «смеси экспертов»: при 26 млрд параметров активны 3,8 млрд, требуется 18 Гбайт VRAM. Генерация начинается со случайного шума, который за несколько проходов становится осмысленным. Скорость: до 1000 токенов/с на H100 и 700 на потребительских GPU.
Главный недостаток — качество ответов ниже, чем у Gemma 4: скорость в ущерб точности. DiffusionGemma не заменяет Gemma/Gemini, а предназначена для сценариев реального времени, встроенных помощников для написания кода/текста.
Модель хорошо подходит для структурирования, заполнения кода, JSON, логических задач. Она опубликована с открытым кодом (Apache 2.0) и ориентирована на разработчиков и исследователей.

0 комментариев