Оглавление

Компания SpaceXAI официально выпустила свою новую флагманскую модель Grok 4.6, которая, по заявлениям разработчиков, способна на равных конкурировать с лидерами рынка и даже превосходить Claude Fable 5 в специфических сценариях. Как сообщает издание SiliconANGLE, этот релиз состоялся всего через месяц после выхода предыдущей версии, что указывает на агрессивный темп разработки внутри обновленной структуры компании.

Напомним, что до июля этого года проект был известен под брендом xAI, однако после слияния со SpaceX и проведения крупнейшего в истории IPO на бирже Nasdaq, подразделение сменило название. Скорость, с которой Илон Маск выводит новые итерации LLM на рынок, заставляет задуматься: имеем ли мы дело с качественным скачком или же с мастерски упакованным маркетинговым циклом.

Путь от данных к рассуждениям

Основной акцент при создании Grok 4.6 был сделан на улучшение логического вывода и работу с инженерными задачами. Инженеры увеличили время обучения и использовали синтетический датасет, специально сгенерированный ИИ для оттачивания цепочек рассуждений. После основного этапа модель прошла через supervised fine-tuning (SFT) — контролируемое дообучение, где предыдущая версия 4.5 помогала оптимизировать ответы новичка.

Процесс подготовки модели выглядел следующим образом:

  • Сбор и фильтрация высококачественных инженерных данных для глубокого понимания кода.
  • Применение reinforcement learning (обучения с подкреплением) для корректировки поведения модели.
  • Оптимизация формата вывода ответов через SFT, чтобы сделать их более пригодными для использования в реальной разработке.

В тестах на индексе Artificial Analysis Intelligence Grok 4.6 набрал 61 балл. Этот результат ставит его в один ряд с GPT-5.6 Sol от OpenAI и лишь на один балл ниже показателей Claude Fable 5. Примечательно, что в задачах AA-Briefcase, имитирующих длительные рабочие проекты, Grok сумел вырваться вперед, демонстрируя способность удерживать контекст в многонедельных циклах планирования.

Гонка за баллами в бенчмарках начинает напоминать тюнинг автомобилей для драг-рейсинга: на прямой они безупречны, но в реальном городском потоке важны иные качества. SpaceXAI демонстрирует впечатляющую динамику, однако зависимость от синтетических данных и собственной экосистемы для дообучения может создать эффект эхо-камеры. Если модель учится на успехах предшественника, она неизбежно наследует и его слепые зоны, что делает Grok 4.6 скорее мощным инструментом автоматизации, чем прорывом в сторону общего ИИ.

Практическое применение и стоимость

Для тех, кто планирует использовать Grok 4.6 в продакшене, SpaceXAI установила цену в $2 за миллион входных токенов и $6 за миллион выходных. Для задач, требующих максимальной скорости отклика, предусмотрена версия, работающая в два раза быстрее, но и стоимость доступа к ней удваивается. Модель уже интегрирована в платформу для «вайб-кодинга» Cursor, приобретенную компанией за $60 млрд, и внутренний инструмент Grok Build.

Разработчики отмечают, что новая версия стала значительно лучше справляться с созданием визуальных ассетов и интерфейсов. Кроме того, Grok 4.6 теперь чаще перепроверяет свои промежуточные результаты на наличие ошибок при выполнении долгосрочных задач. Это критически важный навык для систем, которым доверяют написание прототипов программного обеспечения по высокоуровневым описаниям, где любая логическая ошибка в начале пути может обесценить весь результат.