Темпы, с которыми Google обновляет свои нейросети, начинают напоминать конвейерную ленту, работающую на предельных оборотах. В среду компания анонсировала две версии новой модели Gemini 3.8 Flash, каждая из которых заточена под специфические сценарии использования. Как сообщает издание VentureBeat, разработчики представили стандартную версию для широкого круга задач и специализированную Flash Cyber для поиска уязвимостей.
Стандартная 3.8 Flash позиционируется как «рабочая лошадка» для создания ИИ-агентов, разработки программного обеспечения и выполнения сложных многоступенчатых рассуждений. Генеральный директор Google Сундар Пичаи отметил в социальной сети X, что новинка демонстрирует значительный качественный скачок по сравнению с версией 3.7, особенно в задачах кодинга. На бенчмарке DeepSWE модель обошла многие крупные фронтирные решения, сохранив при этом низкую стоимость эксплуатации.
Агенты и кодинг: практическое применение
Для тех, кто привык считать токены, новости обнадеживающие: цена осталась на уровне предыдущей версии — $0,75 за миллион входных токенов и $3,75 за миллион выходных. Модель обладает контекстным окном в 1 миллион токенов и способна обрабатывать не только текст, но и изображения, аудио, видео, а также PDF-файлы. В Google подчеркивают, что 3.8 Flash «работает усерднее», проявляя большее прилежание при выполнении сложных инструкций.
В качестве демонстрации возможностей компания показала, как нейросеть создает игры и инструменты с помощью простых промптов на платформе Antigravity. Среди примеров — полноценная 3D-игра с использованием текстур Nano Banana, функциональная DOS-версия Google Maps и топографический визуализатор на основе реальных данных Геологической службы США. В рейтинге Agent Arena от Arena.ai модель заняла 14-е место, совершив внушительный прыжок с 32-й позиции, которую занимала версия 3.7.
Частота релизов Google Flash указывает на попытку захватить рынок через демпинг вычислительной сложности, где скорость важнее глубины рефлексии. Однако за маркетинговым лоском «усердной работы» скрывается риск избыточной генерации токенов там, где хватило бы лаконичного ответа. Это эффективный инструмент для массовой автоматизации, но его реальная ценность будет проверяться не на синтетических тестах, а в способности не плодить «галлюцинации» в длинных цепочках агентских рассуждений. Google строит отличный конвейер, но качество деталей на выходе всё ещё требует бдительного надзора инженера.
С показателем 59 баллов модель сравнялась с такими тяжеловесами, как GPT-5.6 Sol и Grok 4.6, что выглядит особенно иронично на фоне позиционирования Flash как «легкого» решения.
В тестах на сложное многоступенчатое рассуждение HLE-Verified модель набрала 54,9%, показав наиболее заметный прогресс в области долгосрочного программного инжиниринга. Хронология релизов Google в последнее время напоминает спринт: это уже третий выпуск серии Flash за последние полтора месяца, что явно указывает на попытку компании наверстать упущенное после задержек с флагманской версией Pro.
Специализированная охота за багами
Вторая новинка, Flash Cyber, ориентирована на специалистов по информационной безопасности. Модель уже используется внутри Google для защиты собственного кода и показала впечатляющие результаты: она нашла в 2,6 раза больше корректных патчей для уязвимостей в Chrome, чем гораздо более крупные коммерческие аналоги. Примечательно, что нейросеть обнаружила баг в Chromium, который оставался незамеченным инженерами в течение 13 лет.
На текущий момент доступ к Flash Cyber ограничен кругом «доверенных защитников» через программу Fairwind, в которую входят государственные органы и операторы критической инфраструктуры. Это связано с тем, что модель имеет более мягкие фильтры безопасности для анализа потенциально опасного кода, что требует осторожности во избежание злоупотреблений в наступательных целях.
Специалисты компании Wiz, недавно приобретенной Google, подтвердили эффективность модели: в тестах на проникновение Flash Cyber нашла на 7,5–9,7% больше реальных уязвимостей, чем конкуренты. При этом стоимость такого анализа оказалась в 2,3–5,2 раза ниже. Ралька Ада Попа, возглавляющая направление безопасности Gemini, отметила, что в условиях «апокалипсиса уязвимостей», вызванного генеративным ИИ, такие инструменты становятся единственным способом для защитников успевать за атакующими.
Оставить комментарий