4.1 Из каких компонентов состоят решения Physical AI

В этом параграфе мы дадим упрощённую картину компонентов, из которых складываются решения Physical AI.

Его задача — помочь вам увидеть общую структуру системы. Более подробно каждый важный компонент мы разберём в одном из следующих параграфов главы. А заодно подскажем, где можно углубиться.

Блоки Physical AI

С точки зрения структуры Physical AI можно разбить на два основных блока: Edge Physical AI и Cloud Physical AI.

Edge Physical AI (Physical AI на устройстве) — это подсистема Physical AI, которая работает непосредственно на роботе. Она включает алгоритмы и устройства, которые помогают роботу двигаться и воспринимать информацию с помощью нейронных сетей.

Cloud Physical AI (Physical AI в облаке), в свою очередь, представляет собой систему для поддержки искусственного интеллекта в облаке. Она включает алгоритмы обучения моделей, инфраструктуру для хранения данных и вычислительные мощности, необходимые для обучения нейронных сетей.

Таким образом, всё, что работает непосредственно на роботе, — это edge-часть, а всё, что работает удаленно, — это cloud-часть.

Physical AI нужен, чтобы робот не просто действовал, а думал. Однако это не так просто.

Чтобы робот начал думать, нам нужно создать модель на основе нейронной сети и загнать данные в эту модель. Работа с моделью — это не просто вызов функции.

Есть два режима работы сети: инференс и обучение, — и у них разные цели.

  • Обучение — это создание модели на основе данных, и обычно оно происходит в облаке.
  • После обучения модель нужно подготовить для инференса, а код для «выполнения» обученной модели нужен только на edge-устройстве, но не нужен во время обучения.

Поэтому, чтобы робот начал думать, нужно собрать данные, обучить модель по этим данным и отправить модель обратно на edge-устройство, где можно снова собрать данные и повторить цикл. Такой пайплайн описан в этом параграфе и представляет собой непрерывный цикл взаимодействия между Edge Physical AI и Cloud Physical AI.

Physical AI — это не один «умный ящик», а целая система из облачных, программных и железных компонентов. Чтобы такие системы работали как надо, необходимо участие людей разных профессий: ML‑инженеров, конструкторов, специалистов по инфраструктуре и многих других.

Сделать действительно эффективный Physical AI силами одной специальности просто нереально — здесь важна командная работа.

Далее мы подробнее расскажем, из чего состоят Edge Physical AI и Cloud Physical AI. Покажем взаимодействие этих блоков, а также расскажем, какие специалисты нужны, чтобы запустить решения Physical AI.

Edge Physical AI. Что происходит на роботе

Для начала мы хотели бы рассказать про классическое понимание роботов, которое основано на трёх функциональных блоках: Think, Act, Sense.

Эти блоки означают, что робот может воспринимать реальный мир через свои сенсоры, может думать и принимать решения, а также действовать в реальном мире.

Отсутствие каждого блока превратит роботов во что-то другое. Например, роботы без Think — это не роботы, а обычные контроллеры. Такие контроллеры могут стоять на конвейерах, лифтах и прочей технике.

Устройства без подсистемы Sense — это системы open-loop, про которые мы рассказывали ранее. Они не обладают обратной связью и не могут адаптивно реагировать на изменения. Примеры таких систем — заводские роборуки, которые перекладывают детали из заранее заданных мест. Настоящие роботы — это системы closed-loop, то есть системы, которые корректируют своё поведение на основе воспринимаемой информации.

Устройства без блока Act — это устройства для интеллектуального восприятия, например умные камеры.

Более подробно изучить классическую робототехнику можно в этих книгах:

1. Springer Handbook of Robotics под ред. Б. Сичилиано и О. Хатиба.
2. R. Siegwart и др. Introduction to Autonomous Mobile Robots.

В классической робототехнике мы декомпозируем роботов на большое количество модулей, где каждый модуль относится либо к Think, либо к Act, либо к Sense. При этом границы между этими модулями явные.

Однако решения Physical AI основаны на другом подходе — на end-to-end-подходе, как мы рассказывали ранее. Деление между Think, Act, Sense при таком подходе размыто. Один алгоритм берёт на себя все функции.

Компоненты роботов в Physical AI также можно разделить по уровням:

  • уровень железа;
  • уровень системы;
  • уровень библиотек;
  • уровень решений Physical AI.

Каждый уровень пришёл вместе с новым поколением развития робототехники и искусственного интеллекта. Это похоже на строение мозга, где более древние части, такие как амигдала, расположены у основания мозга, в то время как новые части, как кора головного мозга, расположены снаружи.

Далее мы подробно расскажем про каждый уровень.

Уровень железа

Первый уровень — это ядро робота, его «железо», или, по-другому, аппаратный уровень.

На этом уровне разделение между блоками Think, Act, Sense достаточно явное. Для каждого функционального блока мы используем своё железо.

  • Для компонентов Think используем вычислители.
  • Для подсистемы Act используем актуаторы — например, двигатели и сервоприводы. Актуаторы для роботов могут объединяться в целые блоки: например, в шестиосевые манипуляторы или роботов-гуманоидов.
  • Для подсистемы Sense — датчики и сенсоры, которые могут возвращать информацию в виде изображений, 3D-моделей окружения, данных о касании и моментов.

Компоненты первого уровня — это основа для Edge Physical AI. Без хороших сенсоров и актуаторов мы не получим надёжных решений Physical AI. Актуаторы должны иметь контроллеры, которые точно выполняют заданные профили движения, а сенсоры должны иметь минимум шумов, выбросов и задержек.

Алгоритмы восприятия и управления роботами не смогут в полной мере компенсировать недостатки железа.

Уровень систем

Поверх уровня железа идёт второй уровень — уровень систем.

Уровень систем объединяет программные компоненты и железо в одно целое. Например, операционные системы и технологии контейнеризации позволяют запускать алгоритмы роботов на физических устройствах и передавать информацию между программными компонентами.

Также на уровне систем необходима реализация связи между актуаторами и сенсорами с основными вычислителями. Эту связь обеспечивают драйверы и микроконтроллеры.

Таким образом, уровень систем — это инфраструктура, которая объединяет компоненты роботов в одну общую сеть. Информационный поток внутри этой сети используется на следующем уровне — уровне библиотек, который, в свою очередь, необходим для реализации решений Physical AI.

Уровень библиотек

Третий уровень — это уровень библиотек, которые обеспечивают способность роботов обрабатывать сенсорные данные, думать и принимать решения.

Как мы уже сказали ранее, Physical AI базируется на глубоком обучении, то есть на применении нейронных сетей для обработки данных. Также, чтобы робот мог «думать» в реальном времени, требуется инференс нейронных сетей, то есть процесс использования обученной модели для анализа новых данных. Поэтому третий уровень в основном состоит из ML-библиотек.

Если вам интересно узнать об ML и глубоком обучении, то советуем изучить хендбук по машинному обучению от Яндекса.

Третий уровень Edge Physical AI также может включать в себя классические библиотеки и методы. Например, разработчики могут встраивать классические алгоритмы как вспомогательные модули, к которым модель обращается по мере необходимости.

Или, например, эти алгоритмы могут быть использованы для гибридных систем, когда часть работает на основе классических пайплайнов, а часть — на основе решений Physical AI.

Например, упомянутая ранее навигация роботов по типу ALOHA может использовать классические алгоритмы для навигации в пространстве, а для управления рукой могут применяться технологии Physical AI.

Уровень решений Physical AI

Этот уровень включает модели, которые умеют обрабатывать изображения, текст и выдавать действия для роботов. Более того, он включает современные архитектуры нейронных сетей.

На уровне Physical AI подсистемы Act, Think, Sense — это части одной модели. То есть модель Physical AI внутри себя объединяет все компоненты, однако у этого объединения нет явных границ. Внутри Physical AI нет отдельных «папок» с названиями Think, Act, Sense.

Однако можно грубо вычленить слои в моделях Physical AI, которые отвечают за свою функцию. Например, верхние слои могут отвечать за обработку данных от сенсоров, средние — за обработку текста, обдумывание и долгосрочное планирование. А слои, которые ближе к выходу, — за адаптацию команд под конкретное железо робота и учёт динамики этого железа.

конкретное железо проломает учёт динамики этого железа.

Например, в статье π₀: Our First Generalist Policy показана схема структуры модели VLA. На этой схеме изображена часть, которая отвечает за восприятие — ViT, часть, которая отвечает за обдумывание и планирование — pre-trained VLM, и часть, которая отвечает за формирование команд — action expert.

Структура модели VLA pi0. Источник

Структура модели VLA pi0.Источник

Итак, мы рассмотрели четыре уровня Edge Physical AI. Суммируем, что нам известно:

  • Уровень железа позволяет роботам взаимодействовать с реальным миром.
  • Уровень систем связывает все компоненты и железо вместе.
  • Уровень библиотек даёт типовые кубики, на основе которых мы собираем решения.
  • И уровень решений Physical AI творит финальную магию, с помощью модели-генералиста даёт роботам человеческие возможности.

Далее мы посмотрим на вторую часть Physical AI — облачную часть.

Cloud Physical AI. Что происходит в облаке

Основные задачи Cloud Physical AI — это сбор и хранение данных, а также обучение моделей на этих данных. Таким образом, мы можем разбить Cloud Physical AI на три функциональных блока:

  • сбор данных;

  • хранение данных;

  • обучение моделей.

Кроме того, мы можем декомпозировать Cloud Physical AI на уровни по аналогии с Edge Physical AI:

  • уровень железа;
  • уровень системы;
  • уровень библиотек;
  • уровень решений Physical AI.

Далее подробно расскажем про каждый уровень.

Уровень железа

В качестве железа обычно используют GPU, которые стали стандартом для обучения нейронных сетей за счёт способности распараллеливать вычисления. Также разработчики используют различные модификации GPU, которые имеют тензорные ядра, специализирующиеся на обучении моделей.

Помимо вычислителей, на уровне железа важную роль играют хранилища данных. Хранение данных для обучения роботов — это сложная задача, так как их объёмы колоссальны. Например, стандартный датасет для Physical AI Open X-Embodiment «весит» порядка 9 ТБ.

Также для Physical AI необходимо железо для сбора данных на основе телеуправления. Для этого разработчики делают роботов, которыми можно управлять напрямую. Например, можно подключить шлем виртуальной реальности и VR‑контроллеры. Это позволит операторам собирать эпизоды, выполняя различные задачи роботом, — например, перекладывать предметы или заваривать кофе.

Уровень системы

На уровне системы находятся компоненты, которые связывают железо и софт воедино, а также обеспечивают инфраструктуру для обучения моделей. Сюда входят операционные системы, технологии контейнеризации и системы оркестрации. Операционные системы распределяют ресурсы между процессами. Технологии контейнеризации позволяют упаковать приложение со всеми зависимостями в изолированную среду. А системы оркестрации управляют сотнями таких контейнеров одновременно: следят за здоровьем задач, перезапускают упавшие и позволяют запускать множество параллельных экспериментов по обучению.

Уровень библиотек

Третий уровень — это библиотеки и фреймворки, которые обеспечивают процесс обучения моделей и работу с данными. Сюда входят фреймворки для обучения нейронных сетей, инструменты для загрузки и предобработки данных, платформы для симуляции роботов и системы распределённого хранения и обработки больших датасетов.

Уровень решений Physical AI

На самом верхнем уровне Cloud Physical AI находятся алгоритмы и методы обучения искусственного интеллекта. Есть два главных метода:

  • Обучение с учителем (SFT, Supervised fine-tuning) — когда ИИ учится на готовых примерах, как человек учится по решённым задачам из учебника.

  • Обучение с подкреплением (RL) — когда ИИ получает «награду» за правильные действия (как, например, человек учится, выполняя задачи самостоятельно).

Physical AI — это про обучение больших моделей на основе большого количества данных. Одна итерация обучения может длиться несколько недель. Поэтому необходимо распараллеливать обучение нейронных сетей.

Разработчики также применяют инструменты для мониторинга и анализа результатов обучения. Эти системы сохраняют результаты обучения, метрики, веса, а также позволяют сравнивать различные итерации обучения.

Также к этому уровню относятся решения для сбора данных для Physical AI. Нужно собирать не просто размеченные картинки как, например, для задач распознания и сегментации, а траектории движения актуаторов роботов совместно с данными с сенсоров: камер и датчиков. Для этого есть два основных подхода: собирать данные в симуляции и собирать данные за счёт телеуправления робота.

Таким образом, мы рассмотрели основные компоненты, которые необходимы для Physical AI. Теперь посмотрим, как подсистемы Cloud Physical AI и Edge Physical AI работают вместе.

Взаимодействие Cloud Physical AI и Edge Physical AI

Как вы уже знаете, Edge Physical AI и Cloud Physical AI работают как единый цикл. Робот собирает данные и отправляет их в облако, а облако обучает новые модели и отправляет их обратно на робота.

На этапе отправки Edge Physical AI передаёт данные с робота в облако. Для этого используется аппаратная и программная инфраструктура. Ключевые компоненты для отправки — это сеть, протоколы коммуникации и интерфейсы ввода-вывода.

Обратно Cloud Physical AI отправляет модели на роботов, что мы называем релизом моделей. Однако прежде чем отправить модель на робота, нужно её протестировать, что подробно описано в этой главе.

После каждого изменения мы проверяем совместимость кода и моделей, а также работоспособность и надёжность всего решения. Кроме проверок на метрики качества моделей, также используют так называемый контроль на срезах — проверки на определённых поддатасетах, на которых качество моделей не должно падать.

Например, проверяют, что робот всегда умел хватать предметы с бликами.

Кто делает Physical AI: ключевые роли в разработке

Мы разобрались, из каких компонентов состоит Physical AI, а также увидели цикл взаимодействия Edge Physical AI и Cloud Physical AI.

Из разнообразия рассмотренных компонентов видно, что Physical AI — это мультидисциплинарная область. Например, могут быть программные компоненты, аппаратные компоненты и компоненты, связанные с обучением нейронных сетей и ML.

Поэтому для разработки Physical AI требуются разные специалисты:

  • ML-инженеры, которые разработают ML-модели для Physical AI;
  • Software-инженеры, которые напишут код для Physical AI и свяжут все компоненты воедино;
  • конструкторы, которые соберут робота;
  • инфраструктурная команда, которая обеспечит поставку и обработку большого количества данных, а также организует пайплайны поставки моделей на роботов;
  • тренеры Physical AI, которые покажут роботам, как нужно выполнять различные действия, а также проверят действия роботов и разметят их ошибки;
  • проектные и продуктовые менеджеры, а также техлиды, которые обеспечивают слаженную работу и единое видение.

Именно поэтому Physical AI почти всегда делается кросс-функциональной командой: успех определяется не одним компонентом, а связностью всей системы и согласованностью работы ролей.

Что в итоге

В этом параграфе вы познакомились с компонентами решений Physical AI.

Physical AI — это сложная и мультидисциплинарная область, которая объединяет программные и аппаратные компоненты для создания интеллектуальных роботов.

Системы Physical AI состоят из двух основных блоков: Edge Physical AI, который работает непосредственно на роботе, и Cloud Physical AI, который отвечает за сбор данных, их хранение и обучение моделей в облаке.

Взаимодействие между Edge Physical AI и Cloud Physical AI — это непрерывный цикл: данные с робота отправляются в облако, где на их основе обучаются новые модели, которые затем возвращаются на робота. Этот процесс позволяет постоянно совершенствовать способности роботов.

Для разработки и внедрения Physical AI требуются специалисты различных профилей: ML-инженеры, SW-инженеры, конструкторы, специалисты по инфраструктуре, а также операторы для обучения и проверки работы роботов.

В следующих параграфах мы покажем схему компонентов, из которых состоят Cloud Physical AI и Edge Physical AI. А также подробнее расскажем про каждый из этих компонентов.

Чтобы добавить в заметки выделенный текст, нажмите Ctrl + E
Предыдущий параграф3.3. Пайплайн Physical AI
Следующий параграф4.2. Карта компонентов Physical AI. Как пользоваться справочником...