Оглавление

Команда разработчиков Alibaba Qwen анонсировала выпуск Qwen3.8-Flash-Next — мультимодальной модели на базе архитектуры mixture-of-experts (MoE), которая служит технологическим превью для будущего поколения Qwen4. Согласно информации от The Decoder, новинка призвана конкурировать с тяжеловесными нейросетями, требуя при этом лишь малую часть ресурсов на обучение.

В основе модели лежат 125 миллиардов параметров, однако хитрость архитектуры заключается в том, что для обработки одного токена активируются лишь 6 миллиардов. Особый интерес вызывает внедрение N-gram embedding layer на 51 миллиард параметров — инновации, позволяющей хранить устойчивые словосочетания в обычной оперативной памяти (RAM) вместо дорогостоящей видеопамяти GPU, что существенно снижает эксплуатационные расходы.

Модель «из коробки» поддерживает контекстное окно в 262 144 токена, а с помощью метода YaRN этот объем масштабируется до миллиона. Техническая документация уже опубликована на GitHub, а веса доступны для скачивания на платформах Hugging Face и ModelScope. В облаке QwenCloud модель представлена под именем Qwen3.8-Flash с агрессивным ценником: 0,16 доллара за миллион входных токенов.

Девятикратная экономия при росте производительности

Разработчики заявляют, что затраты на обучение Qwen3.8-Flash-Next составили всего одну девятую от стоимости обучения предыдущей версии Qwen3.7-Plus. При этом новая модель демонстрирует превосходство в задачах, связанных с программированием и офисной продуктивностью. Это выглядит как попытка доказать, что грубая сила огромного количества активных параметров уступает место архитектурному изяществу.

В тестах DeepSWE и SWE-bench Pro, имитирующих работу ИИ-агентов по поиску багов в реальном ПО, новинка обошла таких гигантов, как DeepSeek-V4-Flash и Claude Opus 4.6. На бенчмарке CoWorkBench разрыв стал еще заметнее: модель набрала 73,9 балла против 45,1 у конкурента от DeepSeek, что намекает на качественную оптимизацию под рабочие процессы.

Архитектурный фокус с выносом N-грамм в системную память — это изящный способ обойти дефицит GPU, превращающий модель в гибрид нейросети и классического словаря. Однако лидерство в синтетических тестах по программированию часто разбивается о реальный legacy-код, где важна не только логика, но и интуитивное понимание контекста, которое сложно упаковать в 6 миллиардов активных параметров. Alibaba продает нам эффективность, но за низким чеком всегда скрывается компромисс в глубине обобщения данных.

Ценовое давление на западных конкурентов

Выход Flash-версии состоялся вскоре после релиза флагмана Qwen3.8-Max, который напрямую конкурирует с GPT-5.6 Sol и Gemini 3.1 Pro. Новая модель работает лишь немногим слабее флагмана, но в облачном варианте стоит примерно в 12 раз дешевле. Такая демпинговая стратегия заставляет OpenAI и Anthropic пересматривать свои тарифные сетки, что мы уже наблюдаем на примере недавних скидок на линейку GPT-5.6.

Показатель Qwen3.8-Max Qwen3.8-Flash-Next
Вход (за 1 млн токенов) $2.00 $0.16
Выход (за 1 млн токенов) $6.00 $0.47
Активные параметры Не указано 6B

Для индустрии это означает начало эпохи «прагматичного ИИ», где во главу угла ставится не теоретический предел возможностей, а стоимость решения конкретной бизнес-задачи. Пока Anthropic удерживает лидерство лишь в сверхсложных междисциплинарных тестах вроде Humanity’s Last Exam, китайские разработчики методично захватывают рынок прикладных инструментов, где цена ошибки ниже, а цена эксплуатации — решающий фактор.