Fable 5 лидирует в бенчмарке по кодингу, а показатели GPT-5.5 резко рухнули
Модель Claude Fable 5 установила новый рекорд в бенчмарке MirrorCode, в то время как GPT-5.5 показала резкое снижение результатов из-за изменения условий тестирования.
Модель Claude Fable 5 установила новый рекорд в бенчмарке MirrorCode, в то время как GPT-5.5 показала резкое снижение результатов из-за изменения условий тестирования.
Согласно новому индексу Remote Labor Index, возможности ИИ по выполнению фриланс-заказов выросли в четыре раза, достигнув отметки в 16,1%.
Компания Meta* вплотную приблизилась к показателям GPT-5.5 от OpenAI в ключевых тестах производительности с новой нейросетью Watermelon. Глава подразделения супер интеллекта Александр Ванг проинформировал сотрудников о впечатляющих результатах.
Исследование Принстона показало, что современные ИИ-агенты слабы в долгосрочном планировании: в симуляции стартапа CEO-Bench большинство моделей обанкротились.
OpenAI обновила ChatGPT, представив модель GPT-5.5 Instant, которая на 71% точнее отвечает на медицинские вопросы благодаря участию сотен врачей в обучении.
Новый бенчмарк ALE от ученых из Беркли показал, что GPT-5.5 справляется с комплексными профессиональными задачами лучше конкурентов, хотя общий уровень готовности ИИ остается низким.