Стек ценности Physical AI: 11 слоёв робототехники

Перевод X Article Michelle Sun о task-first стеке Physical AI: 11 слоях робототехнических систем, узких местах, данных, вычислениях, симуляции и оценке deployment.

Стек ценности Physical AI: 11 слоёв робототехники

Оригинал: X Article Michelle Sun. Перевод для AI Pulse.

Когда я оцениваю робототехническую компанию, я начинаю с трёх вопросов:

  • Какую задачу выполняет робот?
  • Какая часть системы его ограничивает?
  • Какие доказательства показывают, что это работает повторяемо и при нужной экономике?

Для ответов на эти вопросы я построила task-first стек Physical AI.

Он описывает 11 функциональных слоёв: от части, которая непосредственно касается работы, через приводы, питание и интеллект. Такой стек помогает найти узкое место в системе, понять, где конкурирует компания, и проследить, где накапливается ценность.

Подписаться на будущие материалы можно здесь: corematter.substack.com

Что такое стек Physical AI

Стек Physical AI — это набор аппаратного обеспечения, ПО, данных и операционных систем, который превращает цель в надёжное действие в физическом мире.

Большинство технологических стеков рисуют от базовой технологии наружу: чипы, вычисления, модели, приложения. Для роботов, на мой взгляд, интуитивнее начинать с задачи. Я называю это task-first стеком.

Возьмём работу вроде помещения товара в контейнер. Захват касается товара, привод двигает захват, система питания даёт нужную энергию, управляющее ПО регулирует движение, планировщик ищет выполнимую траекторию, восприятие определяет объект и контейнер, политика выбирает действие, а данные обучают модель.

Есть ещё вычисления, симуляция и оценка — их тоже разберём в этом материале.

Стек Physical AI
Стек, который превращает интеллект в надёжное действие в физическом мире.

Эти 11 слоёв описывают рабочую систему за роботизированной задачей. Под ними лежит промышленный фундамент: энергия, критические материалы, производственные мощности и физическая инфраструктура.

Task-first стек меняет исходный вопрос. Вместо «насколько продвинутой должна быть модель?» лучше спросить: «что должно сработать, чтобы задача была выполнена?» Ответ показывает, какой слой сейчас задаёт потолок системы.

Одна задача через все 11 слоёв

Недавно студент Стэнфорда и стажёр OpenAI Robotics Тейс Симониан дал GPT-6 Astra роботизированную руку SO-101, кисть и камеру, а затем попросил её нарисовать мост Золотые Ворота. Astra планировала действия по одной минуте, оценивала результат и корректировалась между попытками с учётом обратной связи.

Встроенный пост с примером на X.

Это хороший пример того, как работает стек и как выявляется узкое место.

Пример задачи рисования роботом
Как модель, камера, роботизированная рука и кисть превращают инструкцию в физическую картину.

В задаче рисования моста Золотые Ворота узкое место находится на стыке управления и приводов между Astra и роботом. Модель (GPT-6 Astra) могла от итерации к итерации понимать, что нужно улучшить, но интерфейс управления роботом, приводы и ограниченная обратная связь ограничивали точность, с которой рука могла выполнить суждение модели.


Не страшно, если таблица пока не до конца понятна. Ниже мы пройдём по стеку слой за слоем. После этого к таблице можно вернуться — она станет гораздо яснее.

1. Что такое конечный исполнительный орган робота? Задача встречается с миром

Конечный исполнительный орган робота — это часть, которая касается работы. Распространённые формы: параллельный захват, вакуумная присоска, магнитный инструмент и многопалая кисть. Геометрия, сенсоры и материалы определяют, с какими объектами и процессами робот физически может работать.

Рынок включает как специализированную промышленную оснастку под конкретные задачи, так и более универсальные ловкие кисти. SCHUNK, Robotiq и OnRobot продают захваты и инструменты на конец манипулятора. Shadow Robot, Wuji Hand и Sharpa разрабатывают многопалые, или dexterous, кисти. О дизайнах и экономике я писала в Dexterous Hand Primer: Actuation, BOM, Cost Curve, and Where Value Sits in the Hand Stack.

Конечный исполнительный орган должен манипулировать объектами с нужной скоростью, силой, точностью, временем безотказной работы и ценой. Простого захвата достаточно для pick-and-place задач. Ловкая кисть расширяет набор задач, но добавляет суставы, вес и стоимость.

Тактильные и силомоментные датчики находятся рядом с этим слоем; их можно считать слоем 1b. Они сообщают роботу, надёжен ли контакт, не слишком ли он силён и не начинается ли проскальзывание.

Что важно: что именно касается работы, и какие задачи этот выбор открывает или закрывает?

2. Что такое приводы робота? Превратить команду в силу

Приводы преобразуют электрические команды в движение. Именно привод определяет силу, скорость, точность, эффективность и тепловые характеристики, которых может достичь робот.

Суставы гуманоидов должны совместить высокий крутящий момент, низкий вес, компактность, малый люфт, надёжность, стоимость и технологичность производства.

Подробнее о приводах: The Business of Actuators (Part 1) — Core Matter.

Я видела этот слой вблизи на заводе прецизионных шестерён в Сунгане, Шэньчжэнь. 26 проволочно-вырезных станков работали круглосуточно. Сотрудники проверяли детали с жёсткими допусками. Будущая сила, точность и надёжность сустава начинались именно в таких процессах.

Тяжёлый, дорогой или термически ограниченный привод может сдерживать систему даже по мере улучшения программного обеспечения.

Что важно: может ли каждый сустав обеспечить момент, точность и тепловой запас, нужные для задачи, при весе и цене, которые робот способен нести?

3. Что питает робота? Хранить и отдавать энергию

Система питания даёт энергию приводам, вычислениям, датчикам и вспомогательным системам. Для мобильных роботов обычно всё начинается с батарейного блока и продолжается системой управления батареей, силовой электроникой, проводкой, защитой и зарядным интерфейсом.

Ёмкость определяет, как долго робот может работать между зарядками. Вес батареи напрямую конкурирует с полезной нагрузкой, а время зарядки и ресурс циклов влияют на загрузку парка и стоимость замены.

Система питания может ограничивать время работы через частоту зарядки, замену батарей и тепловые пределы.

Что важно: может ли система питания выдержать пиковую нагрузку задачи? Каково время автономной работы робота?

4. Что такое управление роботом? Двигаться к цели

Управление — это программный слой, который превращает желаемое движение в непрерывный поток команд моторам. Контур управления пересчитывает требуемое положение, скорость, момент или ток двигателя сотни и тысячи раз в секунду на процессоре реального времени. Он должен поглощать запоздалое измерение, небольшое столкновение, тяжёлый объект или изменение напряжения батареи, сохраняя стабильность робота и удерживая его в пределах ограничений.

Два распространённых подхода: (1) PID — классический контур обратной связи: он измеряет разницу между текущим и целевым положением сустава, а затем корректирует движение пропорционально этой ошибке. (2) Model predictive control, или MPC, моделирует эффект нескольких возможных команд и выбирает ту, которая удовлетворяет ограничениям вроде лимитов момента, баланса, зазоров от столкновений или энергопотребления.

Многое в этом слое доступно через open-source библиотеки и инструменты вендоров, включая ros2_control, Drake и NVIDIA Isaac. Робототехническим компаниям всё равно приходится интегрировать и настраивать контуры под свою механику, задачи и пределы безопасности. Компании вроде Applied Intuition и Intrinsic также продают части более широкого стека ПО и инструментов для робототехники.

Что важно: когда происходит что-то неожиданное, что удерживает робота в безопасности и на задаче?

5. Что такое планирование движения робота? Выбрать выполнимый путь

Планирование движения — это ПО, которое выбирает выполнимую последовательность движений от текущего состояния робота к цели. Для манипулятора это может включать выбор захвата или размещение объекта без столкновения с полкой. Для мобильного робота — планирование маршрута и последовательности задач.

Классические методы включают поиск по графу, обратную кинематику, сэмплирующие планировщики вроде rapidly exploring random trees и оптимизацию траекторий. MoveIt — open-source фреймворк для манипуляций. MoveIt Pro упаковывает коммерчески поддерживаемый workflow. Библиотека NVIDIA cuMotion ускоряет оптимизацию траекторий на GPU.

Планирование и управление близки, но отвечают за разное. Планирование решает, какое движение попробовать. Управление заставляет робота следовать ему в реальном времени. Этот гид идёт от объекта, поэтому управление появляется раньше. Во время задачи информация обычно течёт от восприятия к планированию и затем к управлению.

Что важно: может ли робот найти безопасный, эффективный путь для текущей сцены и восстановиться, если этот путь не сработал?

6. Что такое восприятие робота? Оценить, что происходит сейчас

Восприятие робота превращает показания датчиков в оценку состояния самого робота и среды. Камеры, depth-сенсоры, LiDAR, силомоментные датчики, тактильные датчики, энкодеры и IMU дают разные типы информации. Камера может распознать посылку. Датчик силы на запястье может показать, что она зацепилась. Тактильный датчик может показать, что она начинает скользить.

Восприятие отвечает на вопрос в настоящем времени: где сейчас объект, робот и релевантные контакты? Модель может использовать эту информацию вместе с инструкцией и целью, чтобы решить, что делать дальше.

Некоторые функции восприятия доступны как библиотеки: распознавание объектов, оценка позы, визуальная одометрия, SLAM и sensor fusion. NVIDIA Isaac ROS — пример упакованного решения. Но в deployment робот всё равно зависит от калибровки сенсоров, задержек и краевых случаев целевой среды.

Управление, планирование и восприятие обычно работают на роботе. Восприятие и планирование часто выполняются на основном бортовом компьютере, а самые быстрые контуры управления — ближе к суставам.

Что важно: что робот должен наблюдать, измерять и выводить, прежде чем сможет действовать надёжно?

7. Что такое VLM, VLA и world models в робототехнике?

Модели интерпретируют наблюдения, рассуждают о цели, прогнозируют исходы или генерируют действия.

  • Vision-language model, или VLM, обрабатывает визуальные и языковые входы. В робототехнике она может интерпретировать сцену и инструкцию и выдавать план высокого уровня.
  • Vision-language-action model, или VLA, объединяет визуальные и языковые входы с выходом в виде действия. Примеры — модели π от Physical Intelligence, Gemini Robotics от Google DeepMind и GR00T от NVIDIA.
  • World model учится тому, как может развиваться сцена. По текущему состоянию и возможному действию она прогнозирует будущее состояние. NVIDIA Cosmos и Marble от World Labs — разные подходы в этой широкой категории.
  • World action model, или WAM, — это world model, которая также выдаёт действия. DYNA-2 от Dyna Robotics — один пример. NVIDIA Cosmos 3 также включает policy-варианты, связывающие прогнозирование видео с действиями робота.

Восприятие оценивает настоящее, world model прогнозирует возможные будущие состояния, а world action model связывает эти будущие состояния с исполнимыми выборами.

Модель поглощает стек. Такие модели всё чаще берут на себя работу, которая раньше лежала в слоях восприятия и планирования. Например, VLA может генерировать chunk действий высокого уровня прямо из изображения камеры и инструкции, обходя несколько рукотворных интерфейсов восприятия и планирования. Она также может генерировать действия более низкого уровня, но быстрый motor control всё равно остаётся под ней. World action model может прогнозировать, как кандидаты-действия меняют сцену, и тем самым поддерживать или частично заменять работу планировщика.

Что важно: какое решение принимает модель, а какие решения остаются за традиционным ПО и управлением?

8. Какие данные обучают Physical AI-системы?

Есть 5 основных типов данных для обучения роботов:

  • Демонстрации роботом, или teleoperation data: человек управляет роботом и записывает наблюдения и действия вместе.
  • Демонстрации человеком, или egocentric data: люди записывают, как сами выполняют задачи.
  • Симуляция: виртуальная среда генерирует траектории, метки и отказы в контролируемых условиях.
  • Интернет- и видеоданные: YouTube и другие онлайн-видео дают демонстрации в масштабе, намного большем, чем парки роботов.
  • Данные deployment: успехи, отказы и восстановления от роботов, выполняющих реальную работу.

Объём — только часть уравнения. Данные также должны быть релевантны задаче, embodiment, сенсорам и среде. Данные об отказах и разнообразие данных тоже критичны.

Вокруг этого слоя формируется целая вселенная компаний. XDOF строит инфраструктуру и датасеты для робототехнических данных. Mecka описывает себя как слой данных, оценки и deployment для Physical AI с фокусом на egocentric human activity.

Что важно: кто может производить данные, релевантные работе этого робота, и как эти данные улучшают следующую версию?

9. Где выполняются вычисления Physical AI?

Робототехника использует как минимум три типа вычислений:

(1) Облачные или датацентровые вычисления обучают модели, обрабатывают данные парков и запускают крупные симуляционные нагрузки вне робота.

(2) Бортовые ускоренные вычисления обрабатывают чувствительное к задержкам восприятие, inference моделей и иногда планирование. NVIDIA Jetson и Jetson Thor — примеры этого уровня. Qualcomm, AMD и специализированные edge-compute вендоры также делают процессоры для этого слоя. Такие компьютеры должны укладываться в бюджет робота по питанию, теплу, весу и стоимости.

(3) Встроенные вычисления реального времени выполняют быстрые функции управления и безопасности на motor drives, микроконтроллерах или процессорах реального времени. Texas Instruments, NXP, Infineon, STMicroelectronics и поставщики motor-drive компонентов делают процессоры и управляющие компоненты для этого уровня.

Что важно: какие вычисления должны происходить на роботе, и может ли железо выполнить их в пределах задержки, питания и теплового бюджета?

10. Для чего используется симуляция в робототехнике?

Симуляция создаёт контролируемую среду для проектирования, обучения, интеграции и стресс-тестирования до того, как policy попадёт в реальный мир.

Симуляция может генерировать разнообразие, которое дорого или небезопасно собирать на железе. Она также позволяет тестировать интегрированный стек до того, как физический робот доступен в масштабе.

Sim-to-real gap — это расхождение между симулированной средой и физической. Контактная физика, износ материалов, освещение и шум сенсоров — частые источники этого разрыва. Policy может хорошо работать в симуляции и всё равно проваливаться в реальном deployment.

MuJoCo — физический движок, широко используемый в исследованиях. Gazebo предоставляет open-source физику, рендеринг и симуляцию сенсоров. NVIDIA Isaac Sim связывает симуляцию с более широким workflow разработки роботов NVIDIA.

Что важно: что команда проверила в симуляции, и какие реальные условия остаются за её пределами?

11. Как оценивать Physical AI-системы?

Оценка проверяет, работает ли система при меняющихся условиях, восстанавливается ли после ошибок и имеет ли экономический смысл. Полезная scorecard включает успешность задачи, частоту вмешательств, поведение при восстановлении, время цикла, задержку, энергопотребление, безопасность и стоимость одной успешной задачи.

Отполированный ролик показывает, что поведение однажды произошло. Deployment evidence проверяет, как часто оно работает, в каких условиях, с какой скоростью, с каким объёмом человеческой помощи и при какой цене.

Оценка также замыкает цикл обучения. Отказ помогает корректировать обучение модели, сбор данных, железо или workflow.

Что важно: как понять, что система работает в целевой среде и бизнес-кейсе?

Где в стеке Physical AI накапливается ценность?

Компании создают наибольшую ценность, когда решают узкое место, которое сдерживает важную задачу.

Лучшие модели снижают нагрузку на вручную собранные слои восприятия и планирования. Лучшие сенсоры, конечные исполнительные органы, приводы и системы питания делают возможным больше поведений или позволяют им работать дольше. Большее deployment даёт больше interaction data. Эти данные затем улучшают модель.

Цикл выглядит так: лучший робот → больше deployment → больше данных → лучшая модель → лучший робот.

Маховик вращается лишь настолько быстро, насколько позволяет самый медленный слой. Для одной компании этот слой — сбор данных. Для другой — кисть, привод, система питания, edge compute, валидация безопасности или сама стоимость эксплуатации робота.

Самая ценная часть стека может меняться по мере развития технологий. Сегодня главным ограничением может быть модель и data pipeline. По мере улучшения моделей узкое место может сместиться к приводу, сенсору или deployment-сети.

Как инвесторы и операторы могут использовать стек Physical AI?

Начните с конкретной задачи и задайте 3 вопроса:

a. Где система учится? Проследите, кто генерирует interaction data, кто ими владеет и как они попадают в следующую версию.

b. Что ограничивает задачу сегодня? Найдите ограничение в модели, сенсорах, механике, питании, надёжности или unit economics.

c. Какие доказательства подтвердят deployment? Запросите условия эксплуатации, успешность задачи, поведение при восстановлении, время цикла, энергопотребление и экономику повторяемой работы.

Task-first стек разбирает роботодемо на цепочку частей, которые можно изучать по отдельности. Проследите задачу от физического контакта назад через весь стек. Тогда проще увидеть, от чего зависит система, где у компании может быть преимущество и где робот с наибольшей вероятностью ошибётся.

Материал перепубликован из Substack Core Matter. Подписаться на следующие выпуски можно здесь: corematter.substack.com.

Subscribe to Temperature 0.7 - AI блог об AI и роботах

Don’t miss out on the latest issues. Sign up now to get access to the library of members-only issues.
jamie@example.com
Subscribe