Оглавление
Исследователи Google Research представили WikiSkill — новую архитектуру, которая наделяет ИИ-агентов долгосрочной памятью через постоянно обновляемую базу знаний. Вместо того чтобы обнулять опыт после каждого сеанса работы, система аккумулирует данные о провалах и успехах в структуре, напоминающей вики-страницу, что позволяет моделям совершенствовать свои навыки итеративно.
Как сообщает The Decoder, предложенный подход решает фундаментальную проблему отсутствия непрерывного обучения у современных больших языковых моделей. Хотя сами веса моделей остаются неизменными, WikiSkill позволяет им формировать более точные внутренние инструкции, упакованные в переиспользуемые модули, называемые Agent Skills.
Трехуровневая архитектура накопления опыта
Система WikiSkill организована по принципу разделения слоев, где каждый уровень отвечает за определенный этап обработки информации. В основании находится Raw Layer — неизменяемое хранилище всех логов выполнения задач, включая вызовы инструментов и полученные результаты. Эти «сырые» данные служат фундаментом для последующего анализа.
Над ним располагается Wiki Layer — уровень дистилляции, где хаотичные следы исполнения превращаются в структурированные выводы о паттернах ошибок и эффективных стратегиях. В отличие от оперативной памяти агента, этот слой никогда не сбрасывается и только растет с каждой новой итерацией, формируя коллективный опыт системы.
Верхний уровень, Skill Layer, содержит конкретные процедурные инструкции, которыми агент руководствуется в текущий момент. Важной особенностью является механизм отката: если обновление навыка приводит к деградации производительности, система возвращается к предыдущей версии, при этом накопленные в «вики-слое» знания о причинах неудачи сохраняются.
- Агент выполняет задачу, генерируя массив данных (Raw Layer).
- Компонент Wiki Maintainer анализирует логи и фиксирует закономерности в вики.
- Skill Proposer предлагает изменения в инструкциях на основе обновленной базы.
- Механизм контроля тестирует изменения и подтверждает их внедрение или инициирует откат.
Использование внешней базы знаний для корректировки поведения LLM — это признание того, что мы пока не умеем эффективно дообучать модели на лету. WikiSkill выглядит как надстройка, компенсирующая статичность нейросетей через текстовую рефлексию. Это работает для логических задач, но создает огромную нагрузку на контекстное окно и вычислительные ресурсы. В итоге мы получаем не самообучающийся разум, а систему с очень продвинутой шпаргалкой, которая рано или поздно упрется в лимиты обработки длинных текстов.
Эффективность масштабирования и переноса навыков
Тестирование проводилось на моделях Qwen (от 4B до 27B параметров), Gemma-4-31B и Gemini-3.5-Flash в пяти различных дисциплинах: от математики до работы с таблицами. Результаты показали, что WikiSkill стабильно превосходит существующие методы эволюции навыков, причем наибольший прирост наблюдается у более крупных моделей.
Например, точность Gemini-3.5-Flash в бенчмарке LiveMath выросла с 33,0% до 72,6%, а в работе с таблицами — с 50,5% до 76,6%. Примечательно, что компактные модели с поддержкой WikiSkill способны демонстрировать результаты, сопоставимые с гораздо более тяжелыми системами, работающими в стандартном режиме без накопления опыта.
Исследователи также обнаружили, что сформированные одной моделью навыки часто поддаются переносу. Инструкции, выработанные мощной Gemini, могут значительно улучшить работу менее способной Qwen. Однако универсальность этого метода ограничена: маленькие модели по-прежнему с трудом справляются с многошаговыми стратегиями в условиях длинного контекста, порой игнорируя «советы» из базы знаний в пользу стандартного поведения.
Оставить комментарий