Исследовательская группа Google DeepMind представила технический отчет о разработке DiffusionGemma — экспериментальной языковой модели, использующей принципы диффузии вместо привычного авторегрессионного метода. Как сообщает The Decoder, инженерам удалось адаптировать готовую модель Gemma-4-26B-A4B, затратив менее десяти процентов от исходного бюджета токенов, что ставит под сомнение необходимость колоссальных вычислительных затрат при создании альтернативных архитектур.
В отличие от классических LLM, которые предсказывают следующий токен один за другим, DiffusionGemma обрабатывает блоки по 256 токенов параллельно. Этот процесс напоминает работу генераторов изображений: модель извлекает осмысленный текст из «шума», постепенно уточняя содержание. На ускорителе Nvidia H100 такая методика позволяет достигать скорости генерации около 1500 токенов в секунду, значительно опережая стандартные версии Gemma 4.
Двухэтапное обучение и магия самокоррекции
Процесс трансформации модели включал два ключевых этапа. Сначала систему обучали восстанавливать зашумленные блоки текста на примерах данных. Затем последовала фаза, которую в Google назвали SD·RL — сочетание обучения с подкреплением и дистилляции семплера. Это позволило одновременно повысить качество ответов и сократить количество шагов вычислений, необходимых для финального вывода.
Интересной особенностью архитектуры стало двунаправленное рассуждение. Обычные модели вынуждены выдавать первый символ ответа до того, как полностью продумают решение, что часто ведет к ошибкам в математических задачах. DiffusionGemma формирует ответ и логическую цепочку параллельно, исправляя неточности в процессе «очистки» текста от шума. В тестах на решение судоку модель показала точность 85%, в то время как базовая Gemma 4 с этой задачей не справлялась вовсе.
Перенос весов обученной LLM в диффузионный пайплайн — изящный способ сэкономить на электричестве, но за скорость приходится платить деградацией логических связей в длинных текстах. Хотя параллельная генерация блоков впечатляет в бенчмарках, реальный выигрыш исчезает при высокой нагрузке на сервер, превращая технологический прорыв в нишевый инструмент для быстрых правок кода. Google создала отличный инженерный концепт, который пока больше напоминает быстрый черновик, чем готовую рукопись.
Ограничения и перспективы применения
Несмотря на впечатляющую скорость, DiffusionGemma пока уступает базовой модели в общей точности. Разработчики связывают это с тем, что архитектура Gemma 4 изначально не проектировалась под диффузию. Кроме того, при агрессивном сокращении шагов вычислений модель иногда попадает в циклы повторений отдельных слов или забывает корректно завершать логические блоки в мультимодальных задачах.
Тем не менее, проект уже находит практическое применение. Стартап Interfaze использует наработки модели для многоязычного распознавания речи, а в медицине ведутся исследования по интерактивному созданию радиологических отчетов. Google опубликовала DiffusionGemma под лицензией Apache 2.0 на платформе Hugging Face, позиционируя ее как фундамент для будущих открытых исследований в области эффективных текстовых систем.
Оставить комментарий