Оглавление

Компания Z.ai официально открыла исходный код своей новой большой языковой модели GLM-5.3-Flash, которая, по заявлениям разработчиков, в десять раз превосходит предыдущие решения по показателю экономической эффективности. Согласно материалу издания SiliconANGLE, этот проект уже успел наделать шума в индустрии под кодовым именем Ox Alpha.

Интрига вокруг модели сохранялась неделю, пока маркетплейс OpenRouter Inc. предлагал бесплатный доступ к ней, не раскрывая создателя. Теперь же карты раскрыты: перед нами архитектура Mixture of Experts (смесь экспертов) с общим числом параметров 320 миллиардов, из которых для генерации одного ответа активируются лишь 18 миллиардов. Модель способна обрабатывать контекстное окно до 1 миллиона токенов, включая текст, изображения и видео.

Технологические хитрости архитектуры

Разработчики внедрили в GLM-5.3-Flash несколько решений, которые позволяют значительно снизить нагрузку на железо. Вместо классического механизма внимания, который перебирает все детали промпта, здесь используется sparse attention (разреженное внимание). Это позволяет алгоритму фокусироваться только на самых значимых фрагментах данных, игнорируя фоновый шум.

Еще одним важным новшеством стало внедрение linear attention (линейного внимания). В стандартных архитектурах потребление оперативной памяти растет квадратично по отношению к длине запроса, однако инженерам Z.ai удалось добиться того, чтобы при удвоении объема данных нагрузка на RAM росла лишь вдвое. Это достигается за счет замены традиционной функции softmax на более эффективный математический алгоритм.

Переход к линейному вниманию и разреженным структурам в моделях такого масштаба — это не просто оптимизация, а попытка взломать экономику ИИ, где стоимость вычислений долгое время была главным барьером. Однако открытость весов при сохранении закрытости процесса селекции обучающих данных оставляет вопрос: имеем ли мы дело с технологическим прорывом или с очень качественной подгонкой под бенчмарки, где лидерство часто оказывается мимолетным. Рынок получает мощный инструмент, но его реальная независимость от инфраструктурных гигантов остается под вопросом.

Производительность и методы обучения

В ходе тестов GLM-5.3-Flash сравнивали с такими тяжеловесами, как Claude Opus 4.8, GPT-5.6 Terra и Gemini 3.7 Flash. Новинка показала лучший результат в тесте GDPval-AA v2, оценивающем способность ИИ к интеллектуальному труду, и заняла второе место в AutomationBench, проверяющем навыки работы в облачных приложениях.

Процесс обучения модели также заслуживает внимания. Z.ai использовала массив данных объемом 30 триллионов токенов. Чтобы избежать искажения градиентов — данных, которые настраивают слои нейросети, — компания применила проприетарную технологию mHC. Это позволило сохранить точность обучения даже при работе с такими колоссальными объемами информации. Веса модели уже опубликованы на платформе Hugging Face для свободного использования сообществом.