Контекст
За последние годы модели мира (world models) — системы, обучающиеся симулировать будущие состояния среды для планирования и управления — существенно продвинулись вперёд. От имитации физики до многошагового предсказания видео эти модели становятся всё мощнее и выразительнее. Тем не менее работ, посвящённых по-настоящему воплощённым агентам (embodied agents — роботам или аватарам, действующим в реальной физической среде), по-прежнему единицы.
Чтобы построить модель мира для такого агента, нужен реальный агент, действующий в реальном мире. В отличие от систем с абстрактными управляющими сигналами (например, простыми командами скорости или поворота), реальный воплощённый агент обладает физически обоснованным и высокоразмерным пространством действий, функционирует в разнообразных жизненных ситуациях и воспринимает мир с эгоцентрической точки зрения — а не через статичные камеры с постановочными сценами.
Почему это сложно
Авторы выделяют четыре ключевые трудности. Первая — сильная контекстная зависимость между действием и зрением: один и тот же вид может предшествовать разным движениям, и наоборот, поскольку человек действует в сложной, целенаправленной, воплощённой среде.
Вторая — высокая размерность и структурированность управления. Движение всего тела охватывает более 48 степеней свободы с иерархической, зависящей от времени динамикой суставов. Третья трудность носит концептуальный характер: эгоцентрический вид фиксирует намерение, но скрывает само тело — модель должна выводить визуальные последствия из физических действий, которые на изображении не видны. Наконец, четвёртая проблема — временно́й разрыв: визуальная обратная связь зачастую приходит через несколько секунд после движения, что требует долгосрочного предсказания и рассуждения во времени.
Человек, как правило, сначала смотрит — и только потом действует: взгляд фиксируется на цели, мозг запускает краткую визуальную «симуляцию» результата, и лишь затем тело движется. В каждый момент эгоцентрический вид служит одновременно входными данными от среды и отражает намерение следующего движения. При этом важно учитывать как действия ног (локомоция и навигация), так и действия рук (манипуляции) — то есть управление всем телом в целом.
Метод и архитектура
PEVA обусловлена кинематическими траекториями позы, структурированными иерархией суставов тела. Для связи движения с эгоцентрическим видением каждое действие представлено в виде насыщенного высокоразмерного вектора, охватывающего как общую динамику тела, так и детальные движения суставов. Вместо упрощённых управляющих сигналов используются глобальный перевод и относительные повороты суставов на основе кинематического дерева тела — 3 степени свободы для трансляции корня и 15 суставов верхней части тела. Применение углов Эйлера для относительных поворотов даёт 48-мерное пространство действий (3 + 15 × 3 = 48). Данные захвата движения синхронизируются с видео по временным меткам, затем преобразуются из глобальных координат в локальную систему отсчёта с центром в тазу для инвариантности к положению и ориентации.
В основе архитектуры — авторегрессионный условный диффузионный трансформер CDiT (Conditional Diffusion Transformer), изначально предложенный в Navigation World Models для простых управляющих сигналов (скорость и поворот). Авторы расширяют CDiT в трёх направлениях. Случайные пропуски по времени (Random Timeskips) позволяют модели усваивать как краткосрочную динамику движения, так и долгосрочные паттерны активности. Обучение на уровне последовательностей (Sequence-Level Training) моделирует целые последовательности движений, применяя функцию потерь к каждому префиксу кадров. Эмбеддинги действий (Action Embeddings) конкатенируют все действия в момент времени t в одномерный тензор для обусловливания каждого слоя AdaLN при работе с высокоразмерным движением всего тела.
Модель обучалась на датасете Nymeria — крупномасштабном наборе данных, совмещающем реальное эгоцентрическое видео с захватом позы тела. При инференсе (генерации) будущие кадры генерируются с обусловливанием на наборе прошлых контекстных кадров: кадры кодируются в латентные состояния VAE-энкодером, к целевому кадру добавляется шум, который затем постепенно устраняется диффузионной моделью. Для ускорения инференса внимание ограничено: внутри изображения оно применяется только к целевому кадру, а контекстное перекрёстное внимание — только к последнему кадру. Авторегрессионная стратегия развёртки работает следующим образом: начиная с контекстных кадров, к ним добавляется текущее действие, модель предсказывает следующий кадр, который добавляется в контекст с удалением самого старого. Процесс повторяется для каждого действия в последовательности, после чего предсказанные латентные представления декодируются в пиксельное пространство VAE-декодером.
Эксперименты
Для проверки понимания моделью связи конкретных движений суставов с эгоцентрическим видом сложные движения человека разбиваются на атомарные действия: движения рук (вверх, вниз, влево, вправо) и движения тела (вперёд, поворот влево, поворот вправо). Иерархический протокол оценки тестирует задачи возрастающей сложности, обеспечивая всесторонний анализ способностей модели. По количественным результатам PEVA стабильно превосходит базовые методы по перцептивному качеству, сохраняет согласованность на длинных горизонтах и демонстрирует хорошие свойства масштабирования с ростом размера модели. Более крупные модели показывают лучшие результаты по метрике FID (Fréchet Inception Distance — метрика качества сгенерированных изображений).
В режиме длинной развёртки модель демонстрирует способность сохранять визуальную и семантическую согласованность на протяжении длительных горизонтов предсказания: PEVA генерирует связные 16-секундные ролики на основе движений всего тела.
PEVA поддерживает визуальное планирование: модель симулирует несколько кандидатных последовательностей действий и оценивает их по перцептивному сходству с целевым состоянием, измеряемому метрикой LPIPS (Learned Perceptual Image Patch Similarity — метрика перцептивного сходства патчей изображений). Планирование формулируется как задача минимизации энергии; оптимизация выполняется методом перекрёстной энтропии (CEM, Cross-Entropy Method) по аналогии с подходом из Navigation World Models. В одном из примеров модель отсеивает пути к мойке или выходу и находит верный путь к холодильнику; в другом — отсеивает движения к стоящим рядом растениям и на кухню, выбирая разумную последовательность к полке. Среди ограничений планировщика: оптимизируются только последовательности для одной руки при фиксированных остальных частях тела, поэтому, например, опускание незадействованной руки не предсказывается. Захват предмета, как в целевом состоянии, модели выполнить не удаётся, однако в ряде случаев она корректно предсказывает втягивание левой руки, близкое к целевому.
Ограничения и перспективы
Авторы подчёркивают, что PEVA представляет собой ранний шаг на пути к воплощённому планированию, а не готовое решение. Планирование в текущей версии ограничено симуляцией кандидатных действий рук и не включает долгосрочное планирование и полную оптимизацию траектории. В модели отсутствует явное обусловливание на намерении задачи или семантических целях; оценка использует сходство изображений как косвенный критерий успеха.
Ключевой следующий шаг — расширение PEVA до режима замкнутого контура управления или интерактивных сред, где модель сможет реагировать на текущее состояние среды в реальном времени. В будущих работах авторы планируют объединить PEVA с высокоуровневым целевым обусловливанием и интегрировать объектно-ориентированные представления для более точного моделирования манипуляций.
Работа частично поддержана грантом ONR MURI N00014-21-1-2801. В числе рецензентов, давших замечания по статье, — Катерина Фрагкиадаки (CMU), Филипп Крэенбюль, Бхаратх Харихаран, Гуань Ши, Шубхам Тулсиани и Дева Раман. Консультации по теории управления предоставил Цзяньбо Ши; поддержку в части Diffusion Forcing — Йилунь Ду; помощь в работах по движению человека — Брент Йи; дискуссию о моделях мира — Алексей Ефрос.