VLM против VLA

VLM против VLA: почему моделей визуального языка недостаточно для робототехники

В дискуссиях о робототехнике часто путают два класса моделей: модели «зрение-язык» и модели «зрение-язык-действие». Они звучат похоже, обе обрабатывают изображения и текст, и обе происходят из одной и той же линии многомодального предварительного обучения. Но для любого, кто пытается внедрить систему ИИ, которая не просто описывает движения, а движется, это различие имеет решающее значение. Разница между VLM и VLA заключается в том, что одна модель понимает сцену, а другая замыкает цикл взаимодействия с физическим миром.

Понимание сцены — это не то же самое, что актёрская игра.

Основные выводы

  • VLM-ы сопоставляют изображения и текст с языковыми выводами; VLA-ы сопоставляют их с действиями робота.
  • VLM-ы не могут напрямую приводить в движение двигатель, захват или концевой манипулятор.
  • VLA расширяют VLM с помощью токенов действий, обученных на демонстрационных данных роботов.
  • В большинстве архитектур VLA основная архитектура VLM настраивается в ходе демонстрационных эпизодов.
  • Для робототехники, предназначенной для развертывания, требуются обучающие данные в стиле VLA, а не только данные VLM.
  • Смешивание этих двух понятий приводит к переоценке возможностей модели восприятия в производственной среде.

Что такое VLM?

Визуально-языковая модель (ВЛМ) — это многомодальная нейронная сеть, которая принимает на вход изображения и текст и выдает текст или структурированные выходные данные. ВЛМ обучаются на парах «изображение-текст» в больших масштабах и превосходно справляются с созданием подписей, визуальными ответами на вопросы и визуальным анализом.

Что такое VLM?

ВЛМ: Мультимодальная модель, которая обрабатывает визуальные и языковые входные данные и выдает языковые или символические результаты, такие как подписи, классификации или цепочки рассуждений.

Виртуальные интерактивные модели обладают мощными возможностями, но их пространство вывода символическое, а не физическое. Они могут описывать происходящее на кухне, идентифицировать объект или отвечать на вопросы о сцене. Но они ничего не могут считывать.

Что такое VLA?

Модель VLA (зрение-язык-действие) — это мультимодальная модель, которая обрабатывает визуальные и языковые входные данные и генерирует последовательности действий робота. Выходное пространство включает команды управления двигателями, положения концевых эффекторов или токены действий, которые декодируются в непрерывные управляющие сигналы.

Что такое VLA?

ВЛА: Базовая модель робота, которая генерирует действия, а не текст — как правило, это дискретизированные токены движения, которые соответствуют степеням свободы робота.

В одной из основополагающих работ, заложивших основу этой парадигмы, RT-2 доработала архитектуру обработки визуально-языковых данных на основе демонстрационных данных робота и выдала дискретизированные токены действий (DeepMind, 2023). Этот переход от текста к действию — и есть вся архитектурная разница.

Чем отличаются обучающие данные VLM и VLA?

Чем отличаются обучающие данные VLM и VLA?

Данные для обучения VLM и данные для обучения VLA различаются по содержимому в конце каждого примера. В примере VLM изображение сочетается с подписью или вопросом-ответом. В примере VLA изображение сочетается с инструкцией и траекторией действия, основанной на конкретной конфигурации робота.

Полезная аналогия: виртуальный медиатор (VLM) — это спортивный аналитик, который может детально описать каждую игровую ситуацию, но никогда не держал мяч в руках. Виртуальный медиатор — это игрок. Экспертиза аналитика реальна и полезна — она просто не заменяет практики работы с мячом. Данные для обучения виртуального медиатора — это именно эти практики: синхронизированные наблюдения, языковые инструкции, обозначения действий и маркеры результатов, повторяющиеся в миллионах эпизодов.

Почему нельзя просто использовать VLM для робототехники?

VLM для робототехникиВ робототехнике нельзя использовать VLM напрямую, поскольку пространство выходных токенов не соответствует командам управления двигателями. VLM выдает слова; роботу же нужны углы сочленений, скорости концевого эффектора или состояния захвата. VLA заполняет пробел между «чашка слева» и «переместите запястье на 4 см влево и закройте захват».

На практике многие команды дорабатывают VLM, превращая их в VLA, расширяя выходной словарь токенами действий — дискретизированными единицами движения, рассматриваемыми как слова. Это сохраняет логическую структуру VLM, одновременно предоставляя ей способ действовать.

Токен действия: Дискретизированное движение робота, закодированное в виде словарной записи, которое модель может предсказать так же, как и языковой токен.

Представьте себе логистический стартап, который лицензирует высококачественную виртуальную модель робота (VLM) и предполагает, что она может управлять роботом-манипулятором. Модель безупречно распознает обстановку, описывает правильный план и не выдает команд управления двигателями. Без обучения с использованием токенов действий система застревает на этапе описания. Добавление данных VLA — вот что открывает возможности для развертывания системы.

VLM против VLA: сравнение бок о бок

Размеры VLM VLA
вход Изображения + текст Изображения + текст + (часто) состояние робота
Результат Язык / символика Токены действий / команды управления двигателем
Тренировочные данные Пары изображение-текст Эпизоды с траекториями развития событий.
Примеры использования Субтитры, VQA, обоснование Робототехника, автономность, воплощенный ИИ
воплощение Ничто Привязан к конкретному роботу или семье.
Оценка Точность, BLEU, полезность Успешное выполнение задачи, обобщение объектно-ориентированного проектирования, безопасность

Когда следует использовать каждый из них?

Используйте VLM, когда задача завершается описанием, решением или текстовым ответом. Используйте VLA, когда задача завершается физическим действием.

В гибридных системах обе модели играют свою роль. VLM отвечают за понимание сцены на высоком уровне, диалог и рассуждения. VLA отвечают за управление с обратной связью. Во многих производственных архитектурах VLM используется в качестве планировщика, а VLA — в качестве исполнителя, иногда в двухсистемных проектах, где происходит обмен скрытыми представлениями между ними. Это различие важно, поскольку им требуются принципиально разные обучающие данные, критерии оценки и контроль качества. (Shaip's) услуги компьютерного зрения и Физический ИИ Операции с данными охватывают оба конца этого спектра.

Заключение

VLM против VLA — это не соревнование, а разделение труда. Оба подхода необходимы для воплощенного ИИ, и оба зависят от обучающих данных, соответствующих их задаче. Выбор правильной модели означает сопоставление ее с правильным пространством выходных данных — и правильным набором данных для ее поддержки.

VLA расшифровывается как «зрение-язык-действие» — это класс моделей, которые принимают на вход визуальные и языковые данные и выдают действия робота. Компонент действия является определяющей особенностью — именно он отличает VLA от более ранних моделей «зрение-язык», которые выдают только текстовые или символические результаты.

VLM можно превратить в VLA путем тонкой настройки на основе демонстрационных данных робота с расширенным словарем токенов действий. Большинство современных VLA создаются именно таким образом, сохраняя логическое мышление VLM и обучая его выдавать команды управления двигателями. Этап тонкой настройки требует высококачественных наборов данных, соответствующих действиям, а не просто дополнительного текста.

VLA — это больше, чем просто VLM с другой головной частью. Хотя многие архитектуры используют общую основу VLM, VLA добавляют декодеры действий, токенизацию с учетом воплощения и функции потерь, связанные с физическим управлением. В некоторых проектах планирование и выполнение разделены на отдельные модули VLM и VLA, которые обмениваются скрытыми представлениями.

Простейший тест на различие между VLM и VLA заключается в том, чтобы определить, что именно выдает модель на выходе. Если на выходе получается предложение, подпись, классификация или цепочка рассуждений, то модель относится к VLM. Если на выходе получается команда управления двигателем, угол поворота сустава или маркер действия, управляющий роботом, то модель относится к VLA. Класс определяется пространством выходных данных, а не модальностью входных данных.

Для VLA-моделей обычно требуется больше тщательно отобранных и структурированных данных, чем для VLM-моделей, даже при меньшем общем количестве токенов. Обучение VLM-моделей основано на использовании зашумленных пар «изображение-текст» из веб-масштаба. Обучение VLA-моделей требует траекторий действий, выравнивания языка на уровне эпизодов и явных меток успеха — все это требует структурированных конвейеров сбора и аннотирования данных.

Тесты VLM имеют ограниченное применение для оценки VLA. Точность создания подписей и визуальные ответы на вопросы измеряют восприятие и рассуждения, а не контроль. Оценка VLA зависит от процента успешного выполнения задач, обобщения на невидимые объекты и среды, а также производительности в сценариях с разным уровнем безопасности — показателей, которые в настоящее время не учитываются ни одним тестом VLM.

Понравилась статья? Подпишитесь на Шаипа в LinkedIn, чтобы получать больше новостей.

Социальная Поделиться