Оглавление

Компания Cognition анонсировала выпуск SWE-2, своей самой продвинутой модели для написания кода, которая устанавливает новый баланс между производительностью и стоимостью. Согласно официальному блогу Cognition, нейросеть достигла показателя 50.0% на бенчмарке FrontierCode 1.1 Main, практически сравнявшись с Fable 5.1, но при этом оказавшись на 64% дешевле в эксплуатации.

Разработчики применили обучение с подкреплением (RL) к модели с 2.8 триллионами параметров, взяв за основу архитектуру Kimi K3. Главным новшеством стал алгоритм, позволяющий тренировать разные уровни сложности рассуждений за один проход. Это позволило SWE-2 вплотную приблизиться к показателям GPT-6 Astra, сохраняя стоимость генерации в четыре раза ниже, чем у флагмана OpenAI.

В отличие от предыдущей версии SWE-1.7, которая иногда грешила избыточным анализом простых задач, новинка демонстрирует более сфокусированное исследование кодовой базы. Модель быстрее переходит от чтения файлов к правкам: на тестах медианное количество шагов до первого изменения сократилось с 48 до 18, что прямо указывает на возросшую «инженерную интуицию» агента.

Математика прогресса и линейные штрафы

Инженеры Cognition решили проблему выбора между скоростью и качеством через изящную математическую модель. Они внедрили функцию вознаграждения с линейным штрафом за стоимость. Каждый уровень усилий модели теперь привязан к локальному наклону кривой Парето, что заставляет ИИ выбирать оптимальный путь решения, не тратя лишние токены там, где это не приносит ощутимого результата в точности.

Для стабилизации обучения была использована взвешенная по длине базовая линия (baseline), которую компания применяет еще со времен версии 1.6. Этот метод снижает дисперсию градиента без дополнительных вычислительных затрат. В итоге удалось добиться того, что модель SWE-2 High берется за сложные архитектурные задачи с глубоким планированием, тогда как версия Medium мгновенно выдает результат для типовых исправлений.

Технологический стек и качество данных

Техническая реализация также претерпела изменения: использование ядер NVFP4 и FP8 вместе с квантованием при обучении позволило сократить расход памяти. Несмотря на трехкратный рост параметров базовой модели относительно предшественника, разрыв между поведением нейросети при обучении и реальной работе удалось минимизировать.

Качество ответов подкрепляется обновленным набором данных. Разработчики утроили количество сред для обучения и создали своего рода «маховик»: предыдущие версии SWE-2 помогали проверять решения новых итераций, выявляя попытки «взлома» системы вознаграждений. Это дисциплинирует модель, заставляя ее перепроверять гипотезы пользователя и запускать тесты вместо того, чтобы просто соглашаться с промптом.

Применение RL к моделям такого масштаба впечатляет, однако привязка штрафов к текущей стоимости токена — это палка о двух концах. Мы видим отличную оптимизацию под конкретные бенчмарки, но вопрос «галлюцинаций» в сложных интеграциях остается открытым. Попытка сэкономить на рассуждениях может привести к тому, что модель пропустит неочевидный баг ради красивой статистики расхода ресурсов. Эффективность здесь куплена ценой упрощения стратегий, и в реальном продакшене это может обернуться «костылями», которые придется вычищать живому инженеру.

Безопасность и предвзятость

В вопросах этики SWE-2 показала высокую устойчивость к цензуре и пропаганде. На тестах, включающих политически чувствительные темы, модель в 98% случаев давала содержательные ответы, не копируя официальные государственные нарративы. Примечательно, что даже при запросах на китайском языке уровень объективности оставался стабильно высоким.

Также была проведена проверка на уязвимости кода в зависимости от контекста заказчика. Исследователи не обнаружили статистически значимых отклонений: модель одинаково безопасно (или небезопасно) пишет код как для западных, так и для восточных сценариев использования. На текущий момент SWE-2 уже доступна пользователям в Desktop-версии Devin и через интерфейс командной строки, постепенно вытесняя старые решения в экосистеме Cognition.