Opus 4.8

Новости

GPT-5.6 Sol обходит Claude Opus 4.8

В новом бенчмарке на скорость разработки GPT-5.6 Sol обходит Claude Opus 4.8

Новая модель GPT-5.6 Sol от OpenAI продемонстрировала значительное превосходство над Claude Opus в задачах по программированию, показав двукратный рост скорости в CUDA-тестах.

Remote Labor Index

ИИ-агенты могут закрыть уже больше 16% задач фрилансеров

Согласно новому индексу Remote Labor Index, возможности ИИ по выполнению фриланс-заказов выросли в четыре раза, достигнув отметки в 16,1%.

CEO-Bench

Большинство ИИ-моделей провалили тест по управлению стартапом в течение 500 дней

Исследование Принстона показало, что современные ИИ-агенты слабы в долгосрочном планировании: в симуляции стартапа CEO-Bench большинство моделей обанкротились.