Оглавление
Современные нейросети научились писать код и поддерживать диалог, однако их восприятие реальности остается фрагментарным, лишенным фундаментального понимания длительности процессов. Как пишет The Decoder, новые исследования показывают, что популярные ИИ-ассистенты не способны адекватно оценить время, необходимое для выполнения задачи, и не осознают, сколько ресурсов они уже затратили.
Исследователи в рамках программы MATS провели серию тестов с использованием 200 задач из набора ProgramBench и собственной базы из 18 бенчмарков. В центре внимания оказались две системы: Claude Code от Anthropic и Codex от OpenAI. Результаты демонстрируют системный сбой в «чувстве времени» у алгоритмов, которые мы привыкли считать интеллектуальными.
Хронометрия без часов: почему оценки ИИ неверны
Эксперимент строился по классической схеме: перед началом работы агент должен был спрогнозировать время выполнения, а после завершения — отчитаться о пройденном сроке. Итоги оказались неутешительными. Большинство моделей склонны к значительному завышению ожиданий, часто называя стандартные 90 минут для задач любой сложности. На практике же отклонения были колоссальными: Claude Code ошибался в среднем в три раза, а Codex — в шесть или даже десять раз.
Любопытно, что точность прогнозов немного росла только на многочасовых дистанциях, тогда как на коротких отрезках ИИ демонстрировал полную дезориентацию. Это наводит на мысль, что перед нами не расчет, а статистическое угадывание наиболее вероятного числа из обучающей выборки, не имеющее ничего общего с реальным анализом сложности алгоритма или объема данных.
Отсутствие встроенного таймера превращает ИИ-агента в исполнителя, который живет в вечном «сейчас». Без привязки к системным часам модель не способна на итеративное улучшение в рамках заданного лимита, что делает ее бесполезной для сложных производственных циклов. Это фундаментальный барьер: пока ИИ не научится чувствовать длительность процесса, он останется лишь продвинутым текстовым редактором, а не автономным сотрудником.
Влияние программной среды на поведение моделей
Исследование выявило прямую зависимость поведения ИИ от внешней программной оболочки, так называемого «харнеса» (harness). При использовании одной и той же языковой модели результаты кардинально различались в зависимости от настройки среды. Claude Code демонстрировал завидное упорство, работая до победного финала (в среднем те же 90 минут), в то время как Codex прекращал выполнение уже через полчаса, игнорируя реальный статус задачи.
Статистика подтверждает этот разрыв: в среде Claude Code модель совершает в 2,5 раза больше шагов, чем в Codex. Это подчеркивает, что «интеллект» агента во многом диктуется не только весами нейросети, но и алгоритмами управления циклом, которые навязывают ему определенный ритм работы, зачастую оторванный от реальности.
Проблема усугубляется неадекватной самооценкой. Модели Opus 4.8 и GPT-5.5 склонны преувеличивать качество своей работы на 20 процентных пунктов. В некоторых случаях агенты рапортовали о 70% успеха, хотя объективные тесты показывали катастрофические 7–14%. Такая самоуверенность в сочетании с потерей ориентации во времени делает автономное использование агентов рискованным занятием.
Единственным эффективным решением на данный момент остается предоставление агенту прямого доступа к инструменту, сообщающему текущее время. В этом случае точность выполнения временных инструкций становится почти абсолютной. Это лишний раз доказывает, что для создания по-настоящему автономных систем нам нужно не просто «кормить» модели данными, но и интегрировать их в физические метрики нашего мира.
Оставить комментарий