Таксономия самоэволюционирующих агентов

Полная русская версия статьи о таксономии самоэволюционирующих агентов: оптимизация артефактов, самосовершенствование обвязки и обучение моделей без эталонных ответов.

Таксономия самоэволюционирующих агентов

Таксономия самоэволюционирующих агентов

Источник: https://x.com/Shilong_Liu_AI/status/2074800880017342665

Автор: Shilong Liu

Самоэволюционирующие агенты становятся всё популярнее. Hermes Agent поддерживает автоматические переиспользуемые навыки. RSI Lab пытается рекурсивно открывать новые алгоритмы. NVIDIA исследует агентную самоэволюцию для роботов. Автоматизированные исследовательские агенты стремятся самоэволюционировать ради научных открытий.

Появляется всё больше работ, где проектируются самоэволюционирующие алгоритмы, включая как методы обучения с подкреплением (RL), так и методы без обучения. Все они используют похожие слова: self-evolving, self-improving, learning, adapting — самоэволюция, самосовершенствование, обучение, адаптация. Но означают ли они одно и то же? Как классифицировать эти работы по разным направлениям? И чем они отличаются от близких терминов вроде self-improving agents, recursive self-improvement, continual learning и test-time training? В этом блоге я предлагаю таксономию самоэволюционирующих агентов, отвечая на эти вопросы.

Модели, обвязка и артефакты

image

Модели, обвязка и артефакты — три ключевых фактора в самоэволюционирующей системе. Модели, обычно большие языковые модели (LLM), — это мозг, который отвечает на промпты. Обвязка включает дизайн циклов, память, инструменты и другие окружающие компоненты. Именно она превращает модели в агентов. Отсюда знаменитое уравнение:

Агент = Модель + Обвязка

Об артефактах говорят реже. Я использую термин «артефакт» для обозначения результатов, которые создают агенты: например, kernel-алгоритмов, найденных агентами, статей и результатов автоматизированных исследователей или новых политик роботов из робототехнических самоэволюционирующих систем.

Связи между ними просты. Модели и обвязка вместе формируют агентов. Затем агенты создают артефакты. В совокупности эти три термина дают удобный способ упорядочить самоэволюционирующие системы.

С этой точки зрения существующие самоэволюционирующие системы можно разделить на три уровня: итеративная оптимизация артефактов, самосовершенствование обвязки и обучение модели без эталонных ответов.

Итеративная оптимизация артефактов

image

Недавняя волна самоэволюционирующих агентов во многом была продвинута итеративной оптимизацией артефактов. Мотивация проста: использовать мощные LLM для создания новых артефактов в сложных оптимизационных задачах. AlphaEvolve использовала coding agents для научных и алгоритмических открытий. В этой таксономии найденные алгоритмы — это артефакты. Позже было предложено несколько автоматизированных исследовательских систем. Один показательный пример: FARS от Analemma AI работала 417 часов и произвела 166 полностью сгенерированных ИИ статей при стоимости около 180 тысяч долларов США. Recursive Superintelligence также нашла более эффективные GPU kernel-алгоритмы.

Системы итеративной оптимизации артефактов концептуально несложны. Человек задаёт цель и критерии оценки. Затем агент снова и снова находит, что можно улучшить, производит новый результат и проверяет, соответствует ли он критериям. Если соответствует — процесс завершается. Если нет — цикл продолжается. Пайплайн AlphaEvolve выше — один из примеров. Читателям этот паттерн, вероятно, уже знаком: такие инструменты, как Codex, Claude Code и OpenClaw, ведут себя похожим образом.

image

Идея интуитивна и, конечно, не нова. Изменилось то, что LLM, особенно модели для программирования, делают этот цикл гораздо более гибким. До того как LLM стали доминировать, исследователи обычно вручную проектировали операторы или действия, а затем строили методы поиска или оптимизации поверх этих операторов. Хороший пример — поиск нейросетевых архитектур. Работы вроде EfficientNet задавали пространство поиска возможных сетевых операторов, а затем искали более удачные дизайны сетей. Это направление успешно решало многие задачи, иногда достигая результатов лучше, чем алгоритмы, спроектированные людьми.

LLM привносят то, что сама модель может выступать одновременно и оператором, и оптимизатором. Она может изобретать новых кандидатов, анализировать предыдущие результаты и решать, где искать дальше. Это делает её мощным инструментом поиска. Мы получаем гораздо большее пространство поиска и при этом более сильный эвристический поисковик.

Ещё один тренд — LLM стали сильнее в задачах с длинным горизонтом. Поэтому цикл улучшения и проверки может работать эффективнее. В 2024 году, всего два года назад, прежние работы вроде LLaVA-Plus могли выполнять меньше пяти вызовов инструментов и требовали частого вмешательства человека. Сейчас же агенты могут работать часами при гораздо меньшем участии человека. С более сильными большими моделями этот цикл становится полезным для ускорения инженерных и научных открытий.

Большинство нынешних агентов работают в цифровых средах: кодовых базах, браузерах, симуляторах, терминалах и других программных системах. Поэтому большинство исследований всё ещё замкнуты в виртуальных средах. Более амбициозное направление — реальный мир. NVIDIA дала агентам возможность находить новые политики роботов, управляя роботами через агентный цикл. LabOS связала агентов с биолабораториями для проведения экспериментов. Qumus построила экспериментатора по квантовым материалам. Если смотреть вперёд, стоит ожидать больше работ по итеративной оптимизации артефактов в физическом мире.

Мир — это устрица агентов.

Самосовершенствование агентной обвязки

image

Почти одновременно с итеративной оптимизацией артефактов в исследованиях стало популярным самосовершенствование агентной обвязки. Мотивация здесь другая. Обучение моделей дорого, поэтому естественный вопрос: можно ли улучшать агентов после развёртывания, не обновляя веса модели?

Похоже, ответ — да. Блестящие исследователи склонны отвечать «да» на каждый ценный вопрос — по крайней мере сначала показывая демо. Исследуются два основных решения: уровень промптов/памяти и уровень инструментов/навыков.

Обучение промптов и память

Мы можем запоминать некоторые вопросы и ответы, чтобы позже отвечать на те же вопросы. Я так делал в средней школе. Но запоминание плохо обобщается и слабо работает на похожих, но отличающихся задачах. Более удачное решение — извлекать полезные правила и сохранять их там, где агент сможет переиспользовать их. Некоторые работы хранят их в промптах, например GEPA. Некоторые — в playbooks, например ACE, или в системах памяти, например Mem0.

Хотя в названиях некоторых методов есть слово «learning», они не изменяют веса модели. Но если рассматривать обвязку как часть агента, то обновления обвязки, например обновления промптов, следует трактовать похожим образом на обновления параметров. Поэтому нет ничего неправильного в том, чтобы называть их методами «обучения».

Это ещё одно ключевое отличие самосовершенствования агентной обвязки от итеративной оптимизации артефактов. Здесь агент изменяет собственные компоненты, например промпты и память, тогда как итеративная оптимизация артефактов фокусируется на оптимизации результатов, а не самого агента.

Создание инструментов и навыков

Но текстовой информации не всегда достаточно. Например, если агенту нужно понять длинное видео и найти ключевые кадры, одной памяти может оказаться избыточно много и при этом недостаточно полезно. Чтобы извлекать ключевые кадры, агенту нужен исполнимый инструмент или навык. Поэтому прямолинейная идея — создавать переиспользуемые инструменты, как в Alita, или навыки, как в Mem-UI, чтобы агенты могли повторять процесс каждый раз, когда сталкиваются с той же проблемой. Инструменты кодируются как код, поэтому агенты могут генерировать их напрямую. Навыки можно рассматривать как более высокоуровневые обёртки вокруг инструментов. После генерации эти инструменты или навыки добавляются к агенту. Затем агент может переиспользовать их для решения похожих задач в следующий раз.

Навыки также можно рассматривать как ещё один тип управления контекстом. Они сокращают длину контекста, потому что агенту больше не нужно помещать каждую деталь в контекстное окно. Контекст важен.

Навыки сейчас стали популярным решением. Они были формализованы Claude Code и стали де-факто компонентами современных агентов. Claude Code может создавать и использовать навыки, как и Codex с OpenClaw. Ещё один горячий репозиторий, Hermes Agent, тоже подчёркивает автоматическое создание навыков.

Как и в случае с обучением промптов и памятью, это требует от агентов изменять самих себя, поскольку инструменты и навыки относятся к обвязке.

К многоагентной самоэволюции

Предыдущие решения красивы, но их трудно масштабировать внутри одного агента. По мере роста playbook и добавления новых инструментов и навыков система может становиться ненадёжной и неэффективной. Если пользователя интересуют только вопросы, связанные с акциями, ему не нужны кулинарные инструменты. Хранение нерелевантных инструментов в системе лишь замедляет агента и иногда сильнее его путает. Путаница может быть и семантической. Если в одного и того же агента внедрить слишком много кулинарных знаний, агент может не понять, означает ли «squeeze» ситуацию на рынке или выжимание апельсина.

Чтобы решить это, становятся полезны эксперты по задачам. Иногда агент-повар и агент по акциям лучше, чем один агент, который пытается справиться с обеими областями. Это ведёт к многоагентным решениям самоэволюции. Наша предыдущая работа Eevee показала, что один агент ограничен, когда данные поступают из очень разных источников или распределений. Поэтому она предлагает использовать несколько экспертных агентов для разных задач, а маршрутизатор назначает каждую задачу подходящему эксперту. Аналогично мы обнаружили, что оснащение агентов набором сгенерированных инструментов для создания специалиста полезно в некоторых специализированных доменах, как в Alita-G.

Многоагентные системы также можно рассматривать как расширение управления контекстом, поскольку каждому эксперту нужно нести только тот контекст, который полезен для его собственных задач. Контекст важен.

Для многоагентных решений ключевое узкое место — как найти подходящего агента, то есть маршрутизация. Один важный вывод состоит в том, что в большинстве случаев маршрутизация не является простым вопросом. Для хорошей производительности требуются более сильные базовые модели, как показано в работе про routing. В этом смысле одна из самых ценных способностей человеческих экспертов — тоже маршрутизация. Мы выдаём задачи агентам и решаем, должны ли они переходить к следующему шагу.

Человек — это маршрутизатор.

Обучение модели без эталонных ответов

image

Это третья тема. По сравнению с оптимизацией артефактов и самосовершенствованием обвязки, это направление обновляет саму модель. Многие работы в этой области могут никогда не называть себя самоэволюционирующими агентами. Обычно они появляются под названиями self-training, weak supervision, self-play, reinforcement learning, test-time training, online learning или continual learning.

Ключевое отличие в том, что обучение меняет веса модели. Проблема в том, как дать модели возможность обновляться, когда нет эталонных ответов, а есть только вопросы, слабые сигналы или опциональный доступ к среде. Цель похожа на самоэволюционирующих агентов, но решения сильно отличаются.

Псевдоразметка или внутренние сигналы

Если у нас нет эталонных ответов, один вариант — построить псевдоразметку из самих данных, как в self-training, или использовать внутренние сигналы, как в TTRL. Затем эти сигналы можно использовать для обучения модели. Если псевдометки трактуются как целевые значения, можно использовать supervised fine-tuning (SFT). Если сигналы можно превратить в награды, можно использовать RL, как в DeepSeek-R1.

Например, предположим, у нас есть вопрос: сколько яблок на картинке? Хотя у нас нет истинного ответа, предобученная модель всё же может дать оценку лучше случайной догадки. Допустим, на изображении 5 яблок. Модель может быть более уверена в ответах вроде 4, 5 и 6 яблок — это внутренние сигналы. Эти сигналы не являются идеальными метками, но всё равно могут быть полезной информацией.

Self-play и слабые сигналы из сред

Сигнал обучения может также приходить извне модели. В одних примерах для обучения используется self-play, например SPIN и Absolute Zero. Другие учатся через взаимодействие со средами, например Agent Learning via Early Experience. Я объединяю их, потому что другого игрока тоже можно рассматривать как часть среды.

Есть простой бытовой пример. Если вы зовёте кого-то погулять и не получаете ответа, это всё равно даёт вам информацию. Даже отсутствие ответа от среды может быть слабым сигналом.

Test-time Training (TTT) для архитектуры модели

Test-time Training (TTT) — особый случай. Я включаю его сюда, потому что он пытается решить похожую проблему, но совершенно другим способом. Он никогда не называет себя self-evolving. Одна возможная причина — у него более модное название.

Это целый набор работ. Это направление показывает, что некоторые последовательностные модели можно интерпретировать как выполняющие форму градиентного обновления во время инференса. В этом смысле модель можно рассматривать как непрерывно обновляющую матрицу во время инференса. Для справки рекомендую этот блог о DeltaNet.

Связи с Continual Learning

Continual Learning, также называемое в некоторых контекстах online learning или lifelong learning, восходит к эпохе до LLM. Классическая постановка — визуальное распознавание. Предположим, мы обучили модель распознавать седаны, а теперь хотим, чтобы она также распознавала внедорожники. Простое решение — дообучить модель на изображениях внедорожников, но это может ухудшить её способность распознавать исходные изображения седанов. Тогда ключевой проблемой становится предотвращение катастрофического забывания. Трудно сказать, была ли эта проблема полностью решена. Одно из самых эффективных решений — а возможно, одно из немногих действительно эффективных — всё ещё состоит в том, чтобы проигрывать модели некоторые примеры седанов во время дообучения на внедорожниках.

Однако один и тот же термин со временем может получать совершенно разные значения. Термин «мультимодальное» обучение — хороший пример. Примерно в 2017 году он часто относился к работам по описанию изображений, таким как Bottom-Up and Top-Down Attention. Примерно в 2021 году он часто относился к CLIP-подобным моделям. Примерно в 2023 году его использовали для vision-language models вроде GPT-4V. К 2025 году он также охватывал унифицированные модели, работающие и с пониманием изображений, и с генерацией изображений. Аналогично continual learning в сегодняшних обсуждениях LLM часто означает что-то ближе к самоэволюционирующим агентам, чем к старой постановке с катастрофическим забыванием.

Меняются и люди, и термины.

Размытая граница

Граница между эволюцией модели, обвязки и артефактов становится размытой. Когда мы оптимизируем kernel-алгоритм, цель — артефакт. Но чтобы сделать поиск эффективнее, нам также может потребоваться улучшить собственный дизайн агента: его промпты, инструменты, память или стратегию поиска. Аналогично знания агента ограничены предобучением модели. Когда обвязка достигает своего предела, обновление параметров модели становится естественным следующим шагом. Некоторые недавние работы, например SIA, уже исследовали это направление.

Если смотреть в будущее, я думаю, что каждый модуль в самоэволюционирующей системе должен улучшаться совместно с другими.

Один полезный способ смотреть на прогресс ИИ-инструментов — через абстракцию. Несколько лет назад мы писали каждую строку кода сами. Затем просили ChatGPT писать фрагменты кода. Позже Copilot помогал писать функции и файлы. Сегодня coding agents могут работать над целым проектом. Цель оптимизации сместилась от слов к фрагментам, затем к файлам, а теперь к проектам. Мы продолжаем группировать всё больше элементов вместе, давать им новую абстракцию и мыслить на более высоком уровне.

То же самое должно произойти с системами самоэволюционирующих агентов. Модель, обвязку и артефакт не следует вечно рассматривать как изолированные компоненты. Как только система становится достаточно способной, естественное направление — улучшать их вместе как единую эволюционирующую систему.

Для реального мира

Самая ожидаемая часть самоэволюционирующих агентов — их способность улучшать вещи за пределами самой агентной системы.

Лучший промпт полезен. Лучшая память полезна. Лучший инструмент полезен. Лучшая модель полезна. Но итоговая ценность самоэволюции всё равно должна измеряться тем, помогает ли она нам строить лучшие вещи: более быстрые kernel-алгоритмы, более сильное ПО, новые научные гипотезы, новые материалы и лучшие поведения роботов.

Именно поэтому я использую модель, обвязку и артефакт для организации этой области. Они описывают три места, где может происходить эволюция. Модель может учиться по слабым сигналам. Обвязка может обновлять свою память, промпты, инструменты и навыки. Артефакт может итеративно оптимизироваться агентами. Эти три уровня — разные точки входа в одну большую систему.

В ранних системах эти циклы обычно появляются отдельно. Некоторые работы держат модель фиксированной и улучшают обвязку. Некоторые держат агента фиксированным и улучшают артефакт. Некоторые обучают модель на самосгенерированной или слабой обратной связи. В будущих системах они, вероятно, будут расти вместе. Более сильная модель помогает строить лучшие обвязки. Лучшие обвязки ускоряют поиск артефактов. Лучшие артефакты создают новые данные и обратную связь для обучения модели.

Идея самоэволюционирующих агентов много раз появлялась в прошлом под разными названиями: recursive self-improvement, continual learning, online learning, automated discovery и test-time adaptation. Названия менялись, потому что менялись доступные системы. Сегодня у нас есть большие модели, агенты с инструментами, параллельное выполнение, более богатые среды и более полезные проверочные сигналы.

Вместо споров о названиях мне кажется полезнее задать три простых вопроса.

Что эволюционирует? Какая обратная связь этим движет? Где замыкается цикл?

Если цикл замыкается на бенчмарках, мы получаем более сильные решатели бенчмарков. Если он замыкается на коде, мы получаем лучшее ПО. Если он замыкается на науке и инженерии, мы можем получить лучшие открытия. Если он замыкается на физическом мире, агенты могут стать новым способом строить и улучшать реальные системы.

Мир всё ещё остаётся самой сложной средой. И именно там самоэволюционирующие агенты важнее всего.

Subscribe to Temperature 0.7 - AI блог об AI и роботах

Don’t miss out on the latest issues. Sign up now to get access to the library of members-only issues.
jamie@example.com
Subscribe