модели VLA

Модели VLA: что нужно моделям визуально-языково-действенных моделей от обучающих данных.

Переход от чат-ботов к роботам, выполняющим команды на естественном языке, осуществляется с помощью одного класса моделей. Модели VLA — модели «зрение-язык-действие» — объединяют визуальное восприятие, понимание языка и генерацию действий в одной нейронной сети. Их возможности реальны, но они почти полностью зависят от обучающих данных, которые они обрабатывают. В этом руководстве объясняется, что на самом деле содержат обучающие данные VLA, что недооценивают команды и как спланировать набор данных, который позволит создать модель, достойную внедрения.

Основные выводы

  • Модели VLA напрямую сопоставляют визуальные и языковые данные с действиями робота в рамках одной сети.
  • Обучающие данные должны включать синхронизированные визуальные наблюдения, языковые инструкции и действия.
  • Для эффективного обучения дискретных токенов действий необходимы большие объемы демонстрационных данных.
  • Эгоцентричные видеозаписи с участием людей все чаще используются в качестве недорогого источника для предварительного обучения VLA.
  • Для надежного развертывания так же важны надежные этапы оценки, как и обучающие данные.
  • Успех или неудача тонкой настройки VLA зависит от точности аннотаций, а не только от исходного объема данных.

Что представляет собой модель VLA?

Модель VLA — это базовая модель робототехники, которая принимает на вход изображения и инструкции на естественном языке и выдает на выходе действия робота. В отличие от традиционных конвейеров, которые разделяют восприятие, планирование и управление на разные модули, модели «зрение-язык-действие» обучаются сквозному отображению в рамках одной сети.

обучающие данные визуальное восприятие язык действия модель

Модель VLA: Нейронная сеть, которая обрабатывает синхронизированные визуальные наблюдения и инструкции на естественном языке и генерирует последовательности действий робота или жетонов действий.

Такая унифицированная конструкция позволяет моделям VLA наследовать возможности логического мышления, полученные в результате масштабного предварительного обучения на основе визуально-языковых данных, и расширять их за счет управления моторикой. В контексте развертывания это означает, что одна модель в принципе может выполнять множество задач — но только если ее обучающие данные охватывают их с правильной структурой.

Что на самом деле содержат обучающие данные VLA?

Данные для обучения VLA содержат четыре основных компонента в каждом эпизоде: визуальные наблюдения, инструкцию на естественном языке, траекторию действия и отметку об успехе или неудаче. К ним команды добавляют временные метки, проприоцептивное состояние и оценочные маркеры.

Четыре обязательных слоя

Четыре обязательных уровня:

  1. Визуальные наблюдения — RGB-кадры, часто в сочетании с изображениями глубины или с наручной камеры.
  2. Языковые инструкции — краткие команды на естественном языке, например, «налейте воды в чашку».
  3. Траектории действий — дискретизированные или непрерывные последовательности действий, сопоставленные со степенями свободы робота.
  4. Метки результатов — Явные маркеры успеха, неудачи или частичного завершения для каждого эпизода.

Открытая модель VLA с 7 миллиардами параметров была обучена на более чем миллионе эпизодов, взятых из 22 вариантов роботов (Stanford et al., 2024), что иллюстрирует разнообразие, ожидаемое для обобщения между задачами. Без такого разнообразия модели VLA, как правило, запоминают конкретные объекты, а не обобщают.

Почему аннотирование действий сложнее, чем аннотирование изображений?

Аннотирование действий сложнее, потому что действия существуют в непрерывном многомерном пространстве и зависят от воплощения робота, а не только от содержимого кадра. Разметка ограничивающего прямоугольника на чашке — простая задача; разметка траектории, которая успешно захватывает эту чашку конкретным захватом в конкретной точке контакта, — нет.

Токен действия: Дискретизированное представление движения робота или перемещения концевого эффектора, которое модель VLA может предсказывать подобно языковому токену.

Командам, занимающимся аннотированием, необходимо сопоставить каждый токен действия с соответствующим синхронизированным наблюдением, отметить моменты контакта, зафиксировать восстановление после сбоя и пометить атомарные границы инструкции языка. (Шайп) аннотация данных Рабочие процессы справляются с этим в масштабе, используя структурированные таксономии, настроенные на пространства действий роботов и пороговые значения приемки для каждой задачи.

Какое место занимает эгоцентричное видео, снятое человеком, в обучении с помощью VLA?

Какое место занимает эгоцентричное человеческое видео в обучении с использованием VLA? Эгоцентричные видеозаписи действий человека служат масштабируемым источником для предварительного обучения, заполняющим пробелы, которые не могут быть восполнены реальными данными о роботах. Видео от первого лица, запечатлевшее процесс приготовления пищи, сбора и сборки продуктов, позволяет оценить поведение роботов в масштабе, недоступном для дистанционного управления.

В недавней статье неструктурированные эгоцентрические видеоролики с участием людей были преобразованы в эпизоды в формате VLA — 1 миллион сегментов и 26 миллионов кадров — путем рассмотрения человеческой руки как ловкого конечного манипулятора (Wu et al., arXiv, 2025). Такие данные, полученные с использованием различных типов воплощения, теперь являются стандартной практикой в ​​алгоритмах предварительного обучения VLA.

Подвох в том, что необработанное видео не является обучающими данными. Перед тем как оно попадет в конвейер обработки VLA, его необходимо сегментировать, описать на языке, изменить положение рук и проверить качество. (Шайп) Физический ИИ В рамках одной поставки данных выполняются следующие операции: эгоцентрический захват, преобразование real2sim и аннотирование с использованием VLA.

Как создавать оценочные наборы данных для выявления режимов отказов VLA?

Оценочные наборы позволяют выявлять сбои VLA на этапе разработки, предшествующем обучению, а не после него. Наиболее важны три структуры: критерии успешности в процессе распространения, проверки обобщающей способности вне процесса распространения и сценарии безопасности с учетом уровня риска.

Представьте себе бытовую модель VLA, прошедшую обширное обучение на кухонных задачах. Разумный набор тестов должен включать проверку: известных задач на известных кухнях (внутри системы), известных задач при незнакомом освещении (умеренный уровень сложности задачи), неизвестных объектов с известными инструкциями (обобщение концепции) и редких событий, таких как случайные разливы (уровень безопасности). Без каждого из этих критериев риск развертывания остается неизмеренным.

Полезным нейтральным ресурсом для организации страхового покрытия по уровням риска является... Структура управления рисками искусственного интеллекта NIST, которая разделяет уровни воздействия таким образом, что это четко соответствует структуре оценочного набора.

Данные для обучения VLA: на что следует заложить бюджет

Слой Что в него входит Распространенная ловушка
Визуальные наблюдения Многоракурсная RGB-съемка, датчик глубины, наручная камера Отсутствующие или несинхронизированные метки времени
Язык Инструкции, атомарные описания Нечеткие формулировки, не соответствующие действиям.
Траектории действий Дискретные токены или непрерывные элементы управления Отсутствие соответствия воплощению робота.
Оценка Эпизоды, проверки OOD, уровни безопасности Разработано слишком поздно, после завершения этапа заморозки модели.

Вывод: в данном наборе данных модели VLA либо выигрывают, либо проигрывают.

Максимальные возможности модели VLA определяются её обучающими данными — их объёмом, глубиной аннотаций и строгостью оценки. Команды, которые планируют набор данных как продукт, а не как нечто второстепенное, первыми доходят до развертывания. Команды, которые просто собирают видеоданные и надеются на появление новых возможностей, обычно этого не делают.

Разница заключается в масштабе. Традиционная роботизированная стратегия сопоставляет наблюдения с действиями для одной задачи или небольшого семейства задач. Модель VLA — это стратегия базового типа, которая направлена ​​на обработку множества задач для множества объектов, с учетом инструкций на естественном языке. Обе являются стратегиями; модели VLA — это просто универсальная версия, обученная на более широких данных, соответствующих языку программирования.

Для тонкой настройки обычно используется от нескольких тысяч до нескольких сотен тысяч высококачественных демонстраций, в зависимости от сложности задачи и мощности базовой модели. Предварительно обученные модели VLA существенно снижают требуемый объем данных. Решающим фактором является качество аннотаций и точность языковых инструкций, а не только количество эпизодов.

Обучение модели VLA исключительно на смоделированных данных возможно, но редко бывает достаточным для развертывания. Моделирование хорошо справляется с разнообразием и редкими событиями; сбор данных из реального мира обеспечивает динамику контактов и перенос результатов моделирования в реальный мир. Большинство производственных конвейеров объединяют оба подхода, используя парные бенчмарки, которые явно измеряют разрыв в производительности между моделированием и реальностью.

Для обучения с помощью VLA минимально необходимы синхронизированное RGB-видео и траектория действия. Высокопроизводительные конвейеры добавляют данные о глубине, изображения с наручной камеры, звук, данные с IMU, а также показания силы или крутящего момента в зависимости от класса задач. Непременным условием является синхронизация по времени между различными модальностями — без нее языковые и двигательные сигналы расходятся в процессе обучения.

Оценка набора данных VLA включает четыре этапа проверки: точность соответствия языка и действия, согласованность сегментации эпизодов, широта охвата пространства действий и представление граничных случаев. Наиболее надежной отправной точкой является проверка человеком на основе выборок с калибровкой по эталонному набору данных. Распространенным порогом для успешного использования набора данных является согласованность между аннотаторами по меткам действий выше 95%.

Обучающие данные VLA представляют собой расширенный набор данных для имитационного обучения. Данные для имитационного обучения фокусируются на парах «наблюдение-действие» из демонстраций. Данные VLA добавляют языковые инструкции, многозадачную структуру и широкомасштабное кросс-визуальное покрытие, что позволяет модели обобщать результаты за пределы запомненных траекторий.

Понравилась статья? Подпишитесь на Шаипа в LinkedIn, чтобы получать больше новостей.

Социальная Поделиться