Оглавление
Обновление лидерборда MirrorCode от 3 августа 2026 года принесло индустрии ИИ не просто новые цифры, а повод для серьезной технической рефлексии. Согласно данным, которые приводит Tech Times, модель Claude Fable 5 показала феноменальный результат в 64%, оставив конкурентов далеко позади. Однако внимание экспертов приковано не столько к триумфу лидера, сколько к аномальному падению GPT-5.5, чей результат обвалился с прежних 44% до скромных 10%.
Причина такого «коллапса» кроется не в деградации самой модели, а в изменении конфигурации теста. MirrorCode — это автономный бенчмарк для кодинга, созданный Epoch AI и METR, где агенты должны воссоздавать программы с нуля, имея лишь скомпилированный бинарный файл и документацию. В новой версии лидерборда исследователи исключили простые задачи и ввели обязательное использование языка Ada, что стало непреодолимым барьером для многих систем.
Механика MirrorCode и ловушка для популярных моделей
Бенчмарк MirrorCode имитирует реальную работу инженера: модель не имеет доступа к интернету или исходному коду, используя лишь метод «черного ящика» для анализа поведения программы. Чтобы решение было засчитано, оно должно пройти 100% тестов, включая скрытые наборы данных. Это делает невозможным простое запоминание фрагментов кода из обучающей выборки, заставляя ИИ действительно «понимать» логику приложения.
Текущая конфигурация лидерборда фокусируется на 15 наиболее сложных программах среднего и крупного масштаба. Удаление легкого уровня лишило модели возможности «набивать очки» на простых утилитах Unix. Теперь каждый агент обязан выполнять задачи на двух языках: популярном Go и специфическом Ada. Для GPT-5.5, которая в Ada показывает эффективность лишь на уровне 5%, это стало фатальным фактором.
Разрыв в 44 пункта между лидером и ближайшим преследователем подчеркивает, что чистая вычислительная мощность перестала быть решающим фактором в автономном программировании. Успех Fable 5 в языке Ada, где обучающая выборка в сотни раз меньше Python, доказывает: мы наблюдаем переход от статистического подражания к архитектурному мышлению. Однако 100-миллиардные бюджеты токенов на задачу намекают, что такая автономность пока остается запредельно дорогой игрушкой, не готовой к массовому внедрению в реальный продакшн. Будущее за эффективностью, а не за сжиганием кремния ради прохождения тестов.
Языковая обобщаемость как новый стандарт индустрии
Успех Fable 5 примечателен тем, что модель продемонстрировала практически равные результаты в Go (64%) и Ada (61%). Это критически важный момент: ранее считалось, что ИИ неизбежно деградирует при работе с низкоресурсными языками. Минимальный разрыв в 3 пункта у Fable 5 на фоне огромного провала у семейства GPT (где разница достигает двузначных чисел) указывает на более глубокий уровень обобщения знаний у новой модели.
Кроме того, Fable 5 стала первой системой, успешно решившей задачи по реализации препроцессора C и языка конфигурации Pkl в условиях жесткого лидерборда. Задача с препроцессором C считается одной из самых коварных из-за обилия краевых случаев в макросах и условной компиляции. Реализация Pkl от Apple требует от ИИ понимания архитектуры ленивых вычислений — концепции, на которой ранее «ломались» даже весьма продвинутые агенты.
Хотя Epoch AI применяет фильтры для исключения заученных решений, разработчики признают, что полностью исключить влияние обучающих данных open-source проектов невозможно. Тем не менее, текущий разрыв между Anthropic и OpenAI на данном полигоне выглядит беспрецедентным. Индустрия замерла в ожидании ответов от других игроков, так как MirrorCode спроектирован с запасом сложности на годы вперед, и нынешние 64% — это лишь начало долгого пути к полной автономности.
Оставить комментарий