Мурашки: в робототехнике происходит смена парадигмы
Кен Голдберг о том, почему Agentic Robotics может сдвинуть робототехнику от ручной инженерии и массивов демонстраций к агентам, которые пишут, тестируют и улучшают роботные программы.
Оригинал опубликован Ken Goldberg в X. Перевод полной X Article.
За последние девять месяцев результаты нашей группы и других исследователей изменили мой взгляд на то, насколько быстро будет развиваться робототехника. Новый подход — Agentic Robotics (AR) — меняет правила игры.
Сдвиг состоит не просто в переходе от одной архитектуры robot policy к другой. Это сдвиг в том, где разрабатывается интеллект робота. Вместо того чтобы в первую очередь полагаться на большие наборы физических демонстраций роботов или на инженеров, которые вручную программируют и настраивают каждое новое применение, Agentic Robotics использует многоагентные AI-системы, чтобы писать, тестировать, диагностировать и итеративно улучшать структурированные роботные программы — в основном офлайн.
В январе, вдохновлённый быстрым прогрессом в multi-agent coding, я начал работать с моими студентами в UC Berkeley — в частности, с Letian Fu, Justin Yu, Kaiyuan Chen и Shuangyu Xie — и с командой NVIDIA Robotics: Spencer Huang, Jim Fan, Yuke Zhu и другими, над AR.
AR не опирается на demonstration data (1). Для заданного описания роботной задачи AR использует новейшие LLM- и VLM-системы, чтобы составлять библиотеку ясно определённых модульных роботных «skills» — включая VLA policies — в интерпретируемые системы управления роботами (2).
Ключевая идея — рассматривать генерацию robot policy как задачу программирования. Манипуляционная система может содержать отдельные модули для perception, grasp selection, motion planning, force control и failure recovery. Coding agents могут генерировать и изменять эти модули, тестировать их и улучшать как отдельные skills, так и код для конкретной задачи.
Это вводит третий путь между двумя доминирующими культурами в робототехнике.
Традиционные model-based engineering methods могут быть быстрыми, интерпретируемыми и очень надёжными, но обычно требуют значительной человеческой инженерной работы для каждой новой задачи. Современные model-free и Vision-Language-Action подходы потенциально могут адаптироваться шире, но требуют огромных объёмов robot data и пока недостаточно надёжны для многих промышленных применений.
Agentic Robotics потенциально может объединить важные свойства обоих подходов: мощность и универсальность frontier LLM/VLM моделей со скоростью, структурой и надёжностью исполняемых роботных программ.
Graph-as-Policy (GaP)
В мае мы разработали GaP — graph-based AR harness для управления сложностью agentic context и вывода лёгкого исполняемого кода, совместимого с ROS2 (3). Вместо того чтобы просить одну большую языковую модель сгенерировать весь код для задачи, GaP представляет управление как граф модульных компонентов. Несколько coding agents могут работать над разными nodes, оценивать их performance в simulation, пересматривать их и рекурсивно улучшать итоговую систему.
GaP работает офлайн, создавая lightweight executable code, который затем экспортируется для выполнения и дальнейшей fine-tuning на реальных промышленных роботах.
Мы обнаружили, что GaP может существенно превосходить предыдущие методы на benchmarks по success rate и продолжать улучшать как success rate, так и cycle time через self-learning. GaP показывает, что coding agents могут делать больше, чем генерировать начальную robot policy. Они могут участвовать в итеративном engineering loop: предложить реализацию, оценить её, диагностировать failures, пересмотреть нужные компоненты и попробовать снова.
Но был крупный bottleneck.
Inverse Physics
Self-learning напрямую на физических роботах возможен, но он медленный. Эксперименты должны идти последовательно, failures могут требовать ручного reset, а exploration может повредить hardware или environment.
Точная simulation может быть чрезвычайно полезной для robot learning. Тысячи экспериментов потенциально можно запускать параллельно и намного быстрее real time. Но simulation никогда не идеальна, и у неё есть другая проблема: кто-то должен построить точную simulation физического мира. Inverse Physics нужна, чтобы построить точную physics model для реального робота, задачи и environment. Она связана с Real2Sim и System Identification, но отличается от них. Это всегда требовало значительных engineering efforts. Geometry, lighting, contact parameters, friction, compliance, mass, damping и другие свойства нужно задать или оценить достаточно хорошо, чтобы simulation предсказывала поведение, важное в реальном мире.
В июне мы начали работать с open-source physics simulator Newton и с экспертами NVIDIA по physics simulation, включая Erwin Coumans. Newton предоставляет набор physics models, подходящих для robot simulation.
Мой постдок Kaiyuan Chen начал разрабатывать Robot Sim Studio (RSS), интерактивный frontend к Newton. RSS раскрывает simulation parameters через Viser-based interface со sliders и fast rendering, упрощая инженеру настройку simulation и сравнение её поведения с физическими наблюдениями. Изначально мы рассматривали RSS прежде всего как лучший инструмент для human engineers.
Затем произошло нечто неожиданное.
Real2Sim2Real
3 сентября был выпущен GPT-6 Astra. Имея только одну фотографию реальной сцены, Astra смог быстро создать Blender model, воспроизводящую фото с подходящими lighting и camera position — inverse graphics.
В те выходные несколько исследователей также сообщили о неожиданно сильных результатах Astra в robot-control tasks (4). Мы задумались, могут ли те же способности выйти за пределы inverse graphics и перейти к inverse physics: может ли Astra вывести физические параметры для точной simulation из наблюдений реального мира?
Мы дали Astra доступ к нашему новому RSS tool и короткое видео реального робота в нашей лаборатории, выполняющего deformable manipulation task — стирающего чернила с металлического бруска губкой. Менее чем за час Astra научился использовать RSS, чтобы создать Newton physics model, которая точно воспроизводила видео, включая очень реалистичные деформации губки. Astra был хорош в inverse graphics, но мы не ожидали, что он окажется настолько хорош в inverse physics.
Затем мы дали Astra эту physics simulation и GaP harness. Он сгенерировал robot control graph и рекурсивно улучшил robot success rate и throughput. Затем мы запустили получившийся код на реальном роботе — и он сработал.
Мурашки
Именно тогда у меня пошли мурашки. AR — недостающее звено между model-based и model-free methods; он открывает путь к быстрым и надёжным роботам.
Но не каждое испытание робота было успешным.
В одном trial робот опрокинул металлический брусок. Этот failure оказался особенно информативным: массу бруска нельзя было надёжно вывести из предоставленных визуальных данных. Но это раскрывает одно из важнейших свойств Agentic Robotics. Реальная failure не обязана быть концом engineering process. Она становится новым evidence. Следующий шаг — дать агенту видео этой failure. Агент может обновить simulation или повысить robustness policy к uncertainty, протестировать пересмотренные стратегии в simulation, regenerated relevant portions of the control graph и развернуть новый код.
Это показывает, что inverse physics может существенно уменьшить один из центральных bottlenecks в simulation-based robot learning. Real2Sim может всё больше смещаться от трудоёмкой человеческой инженерной задачи к agentic learning process.
AI agents могут быть медленными. Это не проблема, когда работа происходит offline. Роботу не нужно запускать frontier model во внутреннем control loop. Вместо этого агент работает offline: reasoning, coding, simulating, testing и improving, а затем экспортирует lightweight code, который быстро исполняется на физической системе.
AR создаёт путь к роботным системам, которые объединяют adaptability frontier AI со speed и reliability conventional control.
Я обсуждал GaP с Jeff Mahler, моим сооснователем в Ambi Robotics. В среду 17 сентября Jeff объявил, что применил GaP AR harness для решения реальной промышленной задачи и развернул результат на роботах, сортирующих посылки по всей территории США (5).
Agentic Robotics может работать с тем, что важно для промышленных систем: cycle time, reliability, variability и continuous operation.
Многое ещё предстоит сделать.
Physics models всё ещё несовершенны. Нам нужны более efficient methods для active и curriculum-based self-learning, а также лучшие методы настройки robustness и speed как в simulation, так и в физических системах. Real-world perception и control остаются uncertain, а safety-critical applications потребуют более сильных verification и validation.
Agentic Robotics также пока медленный на уровне coding agent. Это приемлемо для offline policy development, но подход ещё не подходит для всех форм real-time adaptation. Неясно, масштабируется ли эта архитектура до open-ended generalist robots или humanoids (6).
Вывод не в том, что generalist robotics решена. Изменилось нечто более конкретное.
На протяжении десятилетий одним из центральных ограничений робототехники был огромный объём human engineering, необходимый для преобразования task specification в надёжную физическую систему. В последние годы robot learning пытался заменить часть этой инженерии огромными объёмами physical data.
Agentic Robotics предлагает другую возможность: сама робототехника всё больше может автоматизироваться.
AI agents могут писать модульные robot programs. Они могут тестировать эти программы в simulation. Они могут диагностировать failures и изменять выбранные components. Всё чаще они также могут строить и настраивать simulations, в которых происходит это learning. А итоговые системы можно экспортировать как lightweight, interpretable programs для физических роботов.
Если эти способности продолжат улучшаться, bottleneck в робототехнике может сместиться от сбора достаточного количества robot data или наличия достаточного числа инженеров для ручной настройки каждого приложения к формулированию objectives, constraints, interfaces и verification criteria для всё более способных robot-engineering agents.
Это и было бы сменой парадигмы.
Я всегда был осторожен и скептичен в отношении near-term adoption of robots. Теперь я пересматриваю позицию. Timeline для реальных роботов только что заметно продвинулся вперёд.
References
Plenary presentation to researchers at ICRA26. 2 June 2026 (Vienna): “A Tale of Two Cultures: Can Agentic Coding Close the Gap?”. YouTube (45 mins): https://bit.ly/Agentic-Robotics-plenary-by-Ken-Goldberg
I Gave My OpenClaw Agent a Physical Body. Will Knight. WiRed. 20 May 2026: “...AI-powered coding is super exciting because it has the potential to bridge the gap between conventional engineering methods, which are reliable but don't generalize, and contemporary vision-language-action models, which generalize but are not yet reliable,” says Ken Goldberg, a roboticist at UC Berkeley who is exploring the approach.
World Models vs VLAs: The Rift Dividing Physical AI. The Information Daily. by Rocket Drew, 25 June 2026: “...Goldberg and his collaborators recently extended their work in a new technique called 'Graph as Policy' that will be published in a forthcoming paper. In the new approach, multiple coding agents are assigned to tweak distinct 'nodes' for controlling a robot.”
Combining Cultures, from Code to Canvas: Interview. AI Hub. by Ella Scallan. 1 Sept 2026: “I’ve been thinking about the gap between two communities within robotics: the traditional roboticists who have been working for 50-plus years on control methods, model-based methods, and the new wave – the younger generation that has embraced learning and, in many cases, rejects the older methods....”
Footnotes
(1) The 100,000 Year Robot Data Gap. Science Robotics Editorial. August 2025.
(2) CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation. Max Fu*, Justin Yu*, Karim El-Refai*, Ethan Kou*, Haoru Xue*, Huang Huang, Wenli Xiao, Guanzhi Wang, Li Fei-Fei, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi “Jim” Fan, (Nvidia, Berkeley, Stanford, CMU, UT Austin). International Conference on Machine Learning (ICML). Seoul Korea. 9-12 July. 2026.
(3) GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation (VA) Tasks. Kaiyuan Chen 1,∗ Shuangyu Xie 1,∗ Letian Fu 1 Justin Yu 1 William Pacini 1, Sandeep Bajamahal 1, Hudson Kim 1, Jaimyn Drake 1, Daehwa Kim 3, Haoru Xue 1, Jonathan Francis 3, Christian Juette 3, Peter Schaldenbrand 3, Muhammet Seker 3, Ruwan Wickramarachchi 3, Uksang Yoo 1,3, Guanzhi Wang 2, Adithyavairavan Murali 2, Balakumar Sundaralingam 2, Shankar Sastry 1, Spencer Huang 2, Yuke Zhu 2, Linxi “Jim” Fan 2, Ken Goldberg 1. 3 Bosch, 2 NVIDIA, 1 UC Berkeley. To appear: Conference on Robot Learning (CoRL), Austin TX, 9-11 November, 2026.
(4) “GPT-6 Astra scored 95% on a robot control task, up from Fable 5.1's 40%, with 6.2x fewer output tokens at 2.3x lower cost.” Jay Chooi on X: 4 September 2026.
(5) Agentic Robotics Solves an Industrial Robotics Problem. 17 September 2026.
(6) GPT-6 Astra as an Embodied Robot Policy. 11 September 2025.