Большие языковые модели дали искусственному интеллекту работающий рецепт: предварительно обучите крупную модель на широких данных, и общие способности появятся. В робототехнике такого рецепта нет. Робототехнические системы долгое время собирались из отдельных компонентов восприятия, планирования и управления, которые редко складывались в интеллект, который робот мог бы перенести с одной задачи на другую или с одной машины на другую. Центральная проблема воплощённого ИИ — найти аналогичный рецепт, и в этой области пока нет единого мнения о том, каким он должен быть.
Китайская компания X Square Robot, работающая в сфере воплощённого ИИ, сделала необычно чёткую ставку. Она утверждает, что рецептом является интегрированный стек, охватывающий данные, на которых учится робот, модель мира для прогнозирования изменений в физическом мире и модель действий, объединяющую восприятие, планирование, рассуждение и принятие решений для генерации исполняемого поведения робота. Компания также считает, что стек должен создаваться и выпускаться в открытом доступе.
Стек скрепляет небольшой набор принципов, а не единая всеобъемлющая модель.
- Во-первых, базовой единицей данных робота является взаимодействие, а не траектория; демонстрация считается успешной только если она изменяет мир так, как задумано, а не просто потому, что суставы двигались.
- Во-вторых, предварительное обучение должно давать пригодную к использованию способность, а не просто инициализацию для последующей тонкой настройки.
- В-третьих, поведение должно моделироваться вокруг физических событий, а не фиксированных временных интервалов.
Эти принципы делают слои взаимозависимыми, поскольку одни и те же данные, свободные от робота, которые обучают модель действий, структурированы так, чтобы питать и модель мира. Однако стоит уточнить: компания описывает модель мира и модель действий как взаимодополняющие, но независимые семейства моделей, использующие общую кодовую базу. Обе находятся в рамках более широкой Единой модели мира (World Unified Model), которую компания представила как архитектуру для совместного обучения видению, языку, действию и физическому прогнозированию.
Данные для обучения роботов: инженерия ради качества и стоимости, а не масштаба
Для команды X Square Robot одним из главных ограничений для универсальных роботов является стоимость и качество данных взаимодействия, а не количество параметров. Чтобы решить эту проблему, компания создала свою систему сбора данных — Универсальный интерфейс манипуляции (UMI) серии QUANXTA Zero. Она работает, собирая демонстрации от людей, одетых в оснастку с двойными захватами, вместо телеуправления роботом. Сам по себе этот подход не нов и основан на устоявшихся методах сбора данных без участия робота. Выделяют его два инженерных решения.

Первое — это контроль качества, и это самая отличительная часть. Вместо того чтобы принимать записанные траектории как есть, система запускает замкнутый цикл проверки, а её заметным шагом является физическое воспроизведение. Выборка траекторий воспроизводится на реальном роботе, и только те, которые действительно завершают задачу, считаются валидными. Это превращает показатель валидности в измеряемую величину, а не в предположение. Например, захват, который закрывается на долю секунды раньше, всё ещё выглядит как захват в данных, но он уже оттолкнул объект, поэтому его не следует классифицировать как валидный. Небольшой чистый набор данных может быть ценнее, чем большой зашумлённый.
Второе решение — это способ объединения более дешёвых человеческих данных и скудных данных с робота. Компания предварительно обучает модель на большом объёме демонстраций без участия робота для построения общих представлений, а затем добавляет небольшое количество данных с реального робота в качестве якоря для динамики конкретной машины. Сообщается, что это позволяет достичь производительности, сравнимой с набором данных исключительно с робота, при примерно 20-кратном снижении стоимости сбора, в основном за счёт того, что носимая оснастка намного дешевле установки телеуправления.
Получившийся набор данных намеренно модельно-агностичен и отформатирован для подачи как в модели действий, так и в мировые модели. С оговоркой, что самые сильные результаты измеряются на собственных роботах и тестах компании. Для WALL-WM компания выбрала дифференцированный подход. Большинство моделей действий предсказывают фрагмент движения фиксированной длины, исходя из текущего изображения и инструкции. Это удобно, но разбивает поведение на окна фиксированной длительности, так что границы падают там, где диктует прошедшее время, а не там, где заканчивается одно действие и начинается другое. WALL-WM вместо этого рассматривает в качестве единицы семантическое событие, обоснованное действием: целостный элемент поведения, такой как дотягивание, захват или размещение — то, что можно назвать на языке, увидеть на видео и выполнить как движение.

Дизайн WALL-WM отражает особую озабоченность тем, чтобы не отбрасывать знания, уже накопленные большими видеомоделями. Для этого модель text-to-video соединяется с новой сетью действий, которая считывает признаки из видео, не перезаписывая их, что сохраняет визуальное априорное знание. Из этого единого процесса получается два режима. Режим событий работает с сегментами переменной длины и подходит для рассуждения на длинных горизонтах, а режим с фиксированной длиной выдаёт стабильный вывод в реальном времени, необходимый контроллеру. Это помещает WALL-WM между основными моделями действий на основе чанков и чистыми видеомоделями мира, сохраняя предсказательный характер мировой модели и при этом обеспечивая исполняемое управление.
В серии экспериментов компания использовала тест на обобщение, который более специфичен, чем большинство. Модель, обученная на ограниченном наборе данных, оценивалась на долгосрочных задачах в незнакомых условиях и, как сообщается, на собственном робототехническом тесте компании превзошла базовые модели, которые были дообучены на релевантных данных. Это значимый результат, если он подтвердится. Пока что он измерен на собственном бенчмарке компании. С выпуском кода у более широкого сообщества появится возможность тестировать, воспроизводить и развивать эти результаты в разных условиях.
Политика, работающая до тонкой настройки, и осмысленные токены действий
Слой действий несёт две связанные идеи. Первая — это требование, которое компания ставит перед собой с моделью Wall-OSS-0.5, своей моделью видения-языка-действия: предобученная модель должна работать на реальном роботе до какой-либо тонкой настройки под конкретную задачу.

Интерес представляют не столько метрики, сколько дизайн, стоящий за ними. Модель обучается трём целям одновременно: дискретные токены действий, языковая привязка и непрерывная генерация действий. При этом градиенты проходят через все компоненты, а не замораживаются части сети, как в некоторых конкурирующих решениях. К тому же это более строгий метод, поскольку сообщается о ненастроенном поведении, таком как приближение, захват и восстановление, в том числе на деформируемой задаче, исключённой из обучения.
Вторая идея — это сам интерфейс действий, названный X-Tokenizer. Большинство систем, преобразующих непрерывное движение в дискретные токены, выдают коды, которые языковая модель не может интерпретировать. X-Tokenizer переосмысливает токенизацию как обучение семантическому интерфейсу, так что код верхнего уровня отражает намерение движения, в то время как коды нижних уровней несут более мелкие детали, и всё это согласовано с собственными признаками языковой модели.
Полезным следствием является стабильность. Добавление шума к действию почти не сдвигает код намерения, что позволяет одному токенизатору повторно использоваться на разных роботах без перенастройки. Токенизатор внутри промышленной модели действий — это родственный вариант этого подхода. Вместе эти две идеи дают слою действий нечто довольно мощное: способность к переносу.
Будущее стеков воплощённого ИИ
X Square Robot делает ставку на то, что её уникальный подход, объединяющий три слоя, каждый из которых специализируется на решении ключевой части проблемы, выделится среди других стеков воплощённого ИИ. Шаг с физическим воспроизведением, который обосновывает качество данных, необычен и разумен. Переосмысление моделирования мира вокруг событий, с одной основой, обслуживающей и рассуждение, и управление, — это действительно отличный подход. А сочетание стандарта предобучения, пригодного к развёртыванию, с токенизатором, спроектированным как семантический интерфейс, придаёт слою действий необычайную связность.
Оценка X Square Robot выросла до более чем 20 миллиардов юаней (около 2,9 миллиарда долларов США), что говорит о том, что инвесторы всё чаще рассматривают инфраструктуру данных, фундаментальные модели и масштабируемые системы обучения как долгосрочные отличительные преимущества в воплощённом ИИ. Следующий этап принесёт более широкую проверку. Большая часть текущих доказательств получена на собственных роботах и тестах X Square. По мере того как код модели мира становится публичным, и сообщество начинает тестировать, воспроизводить и развивать работу, заявленные возможности будут проверены на большем количестве роботов, задач и сред.
Что дальше для X Square Robot
Чтобы узнать больше о будущих планах, приведённое ниже интервью с командой X Square Robot раскрывает технологии, стратегию и видение компании.
Что с технической точки зрения сделало данный момент подходящим для того, чтобы вложиться в этот стек? Что стало возможным недавно, чего нельзя было сделать пару лет назад?
Это не один прорыв, а несколько тенденций, созревающих вместе. Фундаментальные модели дали нам общее представление для видения, языка и действия, так что можно моделировать то, что робот видит, что ему поручают делать и как его действия меняют мир, в одной структуре, а не как отдельные модули восприятия, планирования и управления. Вычислительные мощности и инфраструктура, наконец, достаточны для крупномасштабного предобучения на данных с длинным горизонтом и множеством воплощений. Не менее важно, что мы поняли: данные, а не размер модели, являются реальным узким местом для универсальных роботов — дефицитом являются разнообразные, качественные и воспроизводимые данные взаимодействия. А мировое моделирование стало практичным. Полезный вопрос больше не в том, как предсказать несколько секунд видео, а в том, как понять, какими способами действия изменяют объекты, контакты и состояния задач. Два года назад эти ингредиенты существовали по отдельности. Сегодня они достаточно зрелы, чтобы работать как одна система.
«Мы поняли: данные, а не размер модели, являются реальным узким местом для универсальных роботов — дефицитом являются разнообразные, качественные и воспроизводимые данные взаимодействия. А мировое моделирование стало практичным».
Ваша система сбора данных записывает демонстрации с помощью носимого VR-снаряжения и специальных захватов, а не телеуправления роботами. Что было не так со стандартным телеуправлением?
Телеуправление построено вокруг управления роботом. Оно заставляет оператора работать в рамках кинематики, задержек и точки обзора машины, и в результате демонстрации получаются более медленными, скованными и менее разнообразными. Мы построили нашу систему вокруг захвата человеческих навыков. Манипуляция — это на самом деле контакт, расчёт времени, координация пальцев и восстановление, а не просто траектория руки, и носимая оснастка записывает это до того, как поведение будет спроецировано на конкретного робота. Она также ломает дорогостоящий закон масштабирования телеуправления, при котором каждой демонстрации нужен робот. Люди могут генерировать богатые данные независимо от какого-либо робота, и ключевое свойство в том, что эти демонстрации всё равно можно воспроизвести и выполнить на физическом роботе через модель. Мобильность удобна, но само воспроизведение — главное, потому что именно оно позволяет повторно использовать одни и те же данные на разных платформах.

Ваш пайплайн, как сообщается, достигает примерно 85-процентного успеха на определённых тестах. Но что ещё должен уметь домашний робот, помимо успешного выполнения задач?
Домашний робот должен знать, когда он неуверен, когда следует замедлиться, когда запросить помощь и как вернуть мир в безопасное состояние после того, как он что-то уронил или неправильно понял запрос. В реальном доме восстановление после сбоев важнее, чем просто успех, потому что дом не сбрасывается сам по себе. Дома также требуют тщательной персонализации, изучения привычек и предпочтений домохозяйства с течением времени, при этом безопасность и доверие являются основными принципами. Именно это сочетание, а не какой-то отдельный навык, отличает способную демонстрацию от робота, с которым люди могут жить.

Как open-source компоненты вписываются в направление Единой модели мира X Square Robot?
Мы рассматриваем эти релизы как слои направления Единой модели мира, а не как изолированные проекты. Wall-OSS-0.5, модель действий, ставит вопрос о том, может ли открытая модель видения-языка-действия получить непосредственно измеримые способности от крупномасштабного предобучения, поэтому это слой способностей. WALL-WM, модель мира, спрашивает, как робот должен понимать изменения в мире, переходя от фиксированных окон к моделированию на уровне событий, поэтому это слой представлений. Система данных поставляет данные взаимодействия, на которых учатся обе модели. Вместе они образуют цикл, в котором модели порождают способности, мировые модели организуют понимание, а open-source сообщество обеспечивает воспроизведение и улучшение. Единая модель мира — это более широкая архитектура, которую поддерживают эти слои, объединяющая видение, язык, действие и физическое предсказание. Мы выпускаем эти компоненты открыто, потому что воплощённый интеллект не может быть решён одной организацией; ему нужно множество воплощений, множество реальных задач и широкая обратная связь, а долгосрочная цель — создать стек, который продолжает учиться и в конечном счёте переводит роботов от лабораторных демонстраций к надёжному повседневному использованию.