Оглавление

Стартап Reflection анонсировала выпуск своей первой открытой модели Beam, специализирующейся на программировании и логических рассуждениях. В отличие от многих конкурентов, компания сделала ставку не на абсолютные показатели производительности, а на исключительную вычислительную эффективность. По данным The Decoder, Beam позиционируется как прямой западный ответ доминирующим сегодня китайским открытым архитектурам вроде DeepSeek и Qwen.

Beam представляет собой архитектуру Mixture-of-Experts (смесь экспертов) с общим числом параметров 501 миллиард. Однако для обработки одного токена система активирует всего 23 миллиарда параметров. Такой подход позволяет существенно сократить операционные расходы, сохраняя при этом высокую точность выводов. В ходе тестов модель показала результаты, сопоставимые с GLM 5.2, потребляя при этом в три-четыре раза меньше вычислительных мощностей.

Масштабное обучение и умная экономия

Разработка Beam потребовала одного из самых масштабных циклов обучения с подкреплением (Reinforcement Learning) в истории открытых лабораторий. Стартап задействовал 10 500 графических процессоров Nvidia GB300 в течение месяца. Интересно, что показатели модели продолжали расти до самого конца обучения, не обнаруживая признаков выхода на плато, что намекает на наличие нераскрытого потенциала у текущей архитектуры.

Для практического применения разработчики внедрили настраиваемый параметр интенсивности рассуждений. Это позволяет пользователю выбирать между быстрыми ответами для простых вопросов и глубоким раздумьем для сложных архитектурных задач, обменивая время генерации на качество. В ходе обучения зафиксированы и эмерджентные способности: модель научилась эффективно искать информацию в сети и взаимодействовать с внешними сервисами, хотя эти навыки не закладывались напрямую.

Эффективность Beam — это не просто экономия серверных мощностей, а признак зрелости архитектуры Mixture-of-Experts, где количество параметров перестало быть единственным мерилом силы. Однако за громким титулом «самой мощной на Западе» скрывается лукавство: пока Beam догоняет китайские аналоги по эффективности, он все еще уступает им в чистой производительности на сложных бенчмарках. Мы видим отличный инженерный продукт, который, тем не менее, играет роль догоняющего в соревновании, где правила устанавливают Пекин и Кремниевая долина.

В таблице ниже приведено сравнение Beam с ведущими моделями в специализированных тестах на написание кода и работу агентов:

Бенчмарк Beam GLM 5.2 Qwen 3.8 Max Kimi K3
DeepSWE v1.1 44.4 44.0 51.0 68.0
Terminal Bench v2.1 80.1 81.0 86.6 88.3
SWEBench Verified 80.9 Н/Д Н/Д Н/Д

Безопасность и планы на будущее

Для обеспечения безопасности Reflection использует гибридный подход: основная модель Beam объединена со второй специализированной нейросетью, отвечающей за соблюдение этических норм и фактическую точность. Разработчики обещают, что модель будет признавать отсутствие знаний в спорных ситуациях вместо того, чтобы галлюцинировать. Ожидается, что веса модели под лицензией Apache 2.0 станут доступны широкой публике до конца октября.

Проект ведут выходцы из Google DeepMind — Миша Ласкин и Иоаннис Антоноглу, которые привлекли около 2 миллиардов долларов инвестиций. Среди инвесторов значится Nvidia, что объясняет доступ к колоссальному количеству видеокарт. Хотя Reflection хранит данные обучения в секрете, открытие весов Beam может стать важным шагом для западных компаний, стремящихся к независимости от закрытых API и дорогостоящих китайских облачных решений.