Оглавление

Создание автономных агентов, способных переписывать собственный код для повышения эффективности, долгое время упиралось в банальную нехватку ресурсов. Как сообщает VentureBeat, исследователи из MIT и Sakana AI представили систему SIFT (Recursive Self-Improvement via Fast Tree Search), которая радикально снижает затраты на оценку новых версий ИИ-помощников.

Традиционный цикл самосовершенствования требует прогона каждой итерации агента через полные бенчмарки, что выливается в тысячи часов работы CPU и внушительные счета за облачные вычисления. SIFT предлагает элегантный обходной путь: вместо того чтобы сразу бросать «сырую» версию кода на сложные тесты, система использует отдельную языковую модель в роли судьи для предварительного отсева.

Судья вместо бенчмарка

В основе SIFT лежит идея, напоминающая процесс найма сотрудников: опытному менеджеру не обязательно видеть кандидата в деле месяц, чтобы понять его потенциал. После генерации патча агент проходит быстрый фильтр на четырех простых задачах. Если он справляется, в дело вступает LLM-судья, который сравнивает код новой версии с уже существующими фаворитами из архива.

Система использует статистическую модель Брэдли-Терри для выстраивания рейтинга на основе парных сравнений. Примечательно, что судья анализирует именно структуру и логику кода, а не результаты выполнения тестов. Это позволяет SIFT работать асинхронно: пока одни ветки кода проходят длительную проверку на бенчмарках, система уже плодит их «потомков», опираясь на вердикт судьи.

Использование LLM в качестве арбитра для оценки кода — это признание того, что семантический анализ программной логики зачастую точнее выявляет потенциал системы, чем ограниченный набор юнит-тестов. Однако такая архитектура несет риск «галлюцинаторного отбора», когда эстетически верный код скрывает глубокие логические изъяны. Внедрение подобных фильтров экономит бюджет, но критически зависит от качества модели-судьи, превращая поиск лучшего агента в игру вероятностей, где цена ошибки — деградация всей ветки развития.

Практические результаты и внедрение

Эффективность подхода подтвердилась на тестах Polyglot. Конфигурация с использованием модели o3-mini достигла точности в 35,1% менее чем за пять часов, потратив всего около 150 долларов в API-кредитах. Для сравнения, предыдущие методы либо требовали значительно больше времени, либо показывали более скромные результаты из-за неэффективного распределения вычислительных мощностей.

Для команд, желающих внедрить подобный подход, исследователи выделяют несколько ключевых этапов настройки процесса, которые можно интегрировать в существующие конвейеры разработки:

  • Создание быстрого фильтра: разработка набора из 3-5 базовых задач, которые мгновенно отсекают неработоспособные патчи.
  • Настройка LLM-арбитража: внедрение механизма парного сравнения реализаций, где модель выбирает наиболее перспективную структуру кода.
  • Асинхронное выполнение: организация очереди, где генерация новых итераций не блокируется ожиданием завершения тяжелых тестов.

Интересно, что в некоторых случаях судья оказывался прозорливее тестов. На бенчмарке TerminalBench агент, показавший лучший результат на малой выборке задач, провалился на полной дистанции из-за ошибок в инструментах командной строки. LLM-судья заранее понизил его рейтинг, заметив рискованные изменения в коде, которые пропустили автоматические тесты. Похоже, в мире самообучающегося ИИ интуиция, упакованная в веса нейросети, становится дешевле и надежнее грубого перебора.