Физические обучающие данные для ИИ

Физические обучающие данные для ИИ: недостающий слой между зрением и действием.

В робототехнике и автономных системах наблюдается знакомая закономерность: флагманская демонстрация прекрасно работает на сцене, та же система терпит неудачу на работающем складе две недели спустя, а анализ причин сбоя сваливает вину на «реальность», которая оказывается более сложной, чем тестовая среда. Некоторые специалисты утверждают, что недостающим элементом является аппаратная часть — более совершенные захваты, датчики силы и крутящего момента, тактильные поверхности. Этот аргумент верен, но неполный. Даже идеальное сенсорное оборудование генерирует потоки необработанных сигналов, которые модель должна обрабатывать. изучить Интерпретировать. Настоящим узким местом, лежащим в основе большинства сбоев физического ИИ, является не датчик, а мультимодальный интерфейс. Физические обучающие данные для ИИ Это позволяет обучать модели тому, что означают эти сигналы, как они соотносятся с визуальным восприятием и какие действия предпринимать, когда мир оказывает сопротивление. В промышленных масштабах таких данных практически нет — и именно в этом заключается недостающий слой.

Что же на самом деле представляет собой «недостающий слой» в физическом искусственном интеллекте?

Привычный цикл физического ИИ — восприятие, принятие решения, действие, адаптация — обсуждается так, как если бы это была проблема аппаратного обеспечения и архитектуры. На практике же каждая стрелка в этом цикле представляет собой выученное поведение. Sense Это означает модель, преобразующую зашумленные, многомерные потоки данных с датчиков в практически применимые оценки состояния. Решение (Decide): Это означает политику, которая претерпела достаточно изменений, чтобы ее можно было обобщить. Действие (Act): означает, что управление осуществляется на основе реальной динамики. Приспосабливать Это означает распознавание за миллисекунды того, что захват ослабевает или деталь смещена, — и коррекцию в процессе движения. Ни одно из этих действий нельзя запрограммировать. Они изучаются на примерах. Когда система физического ИИ не может адаптироваться во время контакта, обычная причина заключается в том, что в ее обучающих данных никогда не было достаточного количества размеченных примеров контакта для обучения. Аппаратное обеспечение может передавать нужные сигналы. Модели по-прежнему необходим набор данных, который делает эти сигналы осмысленными.

Почему наборы данных, содержащие только визуальные изображения, превосходят возможности физического ИИ

Наборы данных, содержащие только визуальные данные, превосходят возможности физического искусственного интеллекта.Представьте себе среднего по размеру оператора склада, внедряющего систему совместной комплектации заказов в трех распределительных центрах. Модель машинного зрения системы была обучена на миллионах изображений товаров. Она мгновенно распознает товары. В первую неделю после запуска в эксплуатацию производительность выглядит хорошо. На третьей неделе пропускная способность падает на треть. Товары, с которыми система испытывает трудности, несложно распознать. увидели Их трудно... обрабатывать: полусмятые картонные коробки, деформирующиеся при контакте, упакованные в термоусадочную пленку связки, которые скользят, и светоотражающие пластиковые контейнеры, которые затрудняют оценку глубины при использовании в сочетании с верхним освещением. Данные визуального анализа позволили модели определить, как выглядят эти предметы. Ничто в обучающем наборе данных не указывало на то, какими они на ощупь, как реагируют на усилие или когда захват вот-вот ослабнет.

Это структурный пробел в большинстве стеков физического ИИ — и он проявляется в наборах данных раньше, чем на производственном участке.

Размеры Набор данных, содержащий только визуальные данные Многомодальный физический обучающий набор данных для ИИ
Условия RGB-изображения, иногда глубина резкости. Зрение, глубина, тактильные ощущения, сила/крутящий момент, проприоцепция, слух
Источник захвата Собранные или постановочные изображения Целевая аудитория: данные, полученные в ходе реального или дистанционного взаимодействия.
Тип аннотации Ограничивающие рамки, сегментация, классы Контактные события, проскальзывание, качество сцепления, профили силы, временное выравнивание
Экономика масштаба Дешево воспроизводить Дорого — каждый образец требует физического взаимодействия.
соответствие задаче на нижнем уровне Восприятие, навигация Манипуляция, адаптация, управление с большим количеством контактов.

Результаты рецензируемых сравнительных тестов показали, что добавление тактильных данных к обучающим конвейерам, использующим только визуальное восприятие, может повысить процент успешных манипуляций примерно на 20 процентных пунктов, а также значительно увеличить его за счет совместной визуально-тактильной предварительной подготовки (Источник: результаты сравнительных тестов IEEE/RSJ IROS, 2024). Разница не незначительна. Это грань между демонстрацией и внедрением.

Четыре слоя реального физического обучающего набора данных для ИИ.

Для создания набора данных, который действительно научит модель действовать в физическом мире, необходимы четыре тесно связанных слоя. Пропустите любой из них, и вся структура выше рухнет.

Четыре слоя реального физического обучающего набора данных для ИИ.

  1. Мультимодальный захват. Набор данных должен содержать то, с чем робот будет взаимодействовать на самом деле: синхронизированное RGB- и глубинное видео, данные LiDAR или стереоизображения (где это необходимо), тактильные сигналы (распределение давления, вибрация, проскальзывание), показания силы и крутящего момента в точке контакта, проприоцептивные данные о состоянии захвата и часто аудиоданные. Конструкция системы захвата так же важна, как и сами датчики — их размещение, калибровка и возможность обработки наиболее важных граничных случаев. Команды, разрабатывающие такие системы внутри компании, обычно объединяют собственные парки оборудования со специалистами. Сбор данных физического ИИ партнерство для обеспечения разнообразия, географического охвата и широты сценариев, необходимых для надежного набора данных.
  2. Синхронизация времени и объединение данных с датчиков. Тактильный всплеск с частотой 1,500 Гц бессмысленен, если не известно, что показывали визуальный поток и датчик силы в ту же миллисекунду. Временная синхронизация между модальностями позволяет модели, например, научиться предсказывать событие скольжения за 40 миллисекунд до падения тактильного давления. Без синхронизации у вас будут параллельные потоки, а не обучающие данные.
  3. Аннотация с подробным описанием контактов. Это самый сложный слой, и большинство программ недооценивают его. Аннотаторам необходимо разметить качество захвата, моменты скольжения, начало и прекращение контакта, положение объекта внутри захвата, деформацию под действием силы и временные границы поддействий. Для правильной работы с этим требуются подготовленные группы аннотаторов, многоуровневая проверка и согласованные рекомендации для всех модальностей — именно поэтому большинство серьезных операций полагаются на рабочий процесс аннотирования структурированных данных вместо того, чтобы пытаться масштабировать это в произвольном порядке.
  4. Постоянная оперативная обратная связь. После развертывания системы физического ИИ каждый успешный захват, почти неудачный случай и сбой становятся новыми данными. Команды, которые замыкают цикл — захват, маркировка, переобучение, повторное развертывание — видят накопительный эффект. Команды, которые не следят за тем, чтобы их модели молча дрейфовали по мере изменения окружающего мира.

Почему аннотирование в физическом ИИ — это отдельная дисциплина

Аннотирование физических объектов в искусственном интеллекте — это отдельная дисциплина.Аннотирование обучающих данных для физического ИИ — это не разметка изображений с дополнительными шагами. Это другая дисциплина. Представьте себе, что вы обучаете ученика повара, а не показываете ему кулинарные видеоролики. Видео учит распознаванию — Это нарезка жульен, а это брунуаз.Ученичество учит, каково это — почувствовать острый нож на твердой луковице, когда сковорода достаточно нагрета без проверки термометра, и как скорректировать хват, когда ручка становится скользкой. Второй вид обучения требует присутствия рядом с учеником человека, который будет маркировать переживаемый опыт момент за моментом. Физическая аннотация с помощью ИИ работает аналогично: аннотаторы не просто отмечают то, что видно; они маркируют события контакта, профили силы, начало скольжения и временные границы действий в синхронизированных потоках данных с датчиков. Это требует аннотаторов, разбирающихся в предметной области, строгого контроля качества и специализированных инструментов. При правильном подходе это превращает необработанные мультимодальные данные в нечто подобное данные для обучения робототехнике Это действительно учит модель обрабатывать контакт. При неправильном выполнении это приводит к появлению размеченного шума.

В заключение — Аппаратное обеспечение завершает цикл; данные его запускают.

Улучшенные захваты, тактильные оболочки и датчики силы — это реальный прогресс. Ничто из этого не устраняет необходимость в многомодальных, синхронизированных, богато аннотированных наборах данных, которые обучают модель тому, что означают эти сигналы в контексте. Организации, сокращающие разрыв между демонстрациями физического ИИ и его внедрением, — это те, кто рассматривает данные как первоклассную инфраструктуру: целенаправленно собирают их, аннотируют с учетом предметной области и постоянно используют оперативные данные для обучения. Аппаратное обеспечение завершает цикл «ощущение-решение-действие-адаптация». Данные для обучения — это то, что его запускает.

Это многомодальный, синхронизированный по времени процесс, основанный на реальных или дистанционно управляемых физических взаимодействиях. Обычные данные для обучения ИИ, как правило, представляют собой текст или изображения, собранные в больших объемах. Физические данные для обучения ИИ должны включать потоки данных с датчиков — зрения, глубины, тактильных ощущений, силы, проприоцепции — записанные во время фактического контакта с объектами и окружающей средой.

Камеры могут показать роботу, как выглядит объект, но не то, как он реагирует на силу, проскальзывает ли захват или как материал деформируется под давлением. Манипуляции — это контактная задача. Без данных о тактильных ощущениях и силе в обучающем наборе модель не имеет основы для адаптации во время контакта.

В отличие от изображений в интернете, каждая тактильная точка данных требует физического взаимодействия — робота или человека, которые фактически касаются, берут или трогают что-либо. Это делает сбор данных медленным, дорогостоящим и чувствительным к калибровке оборудования, поэтому крупномасштабные общедоступные наборы данных остаются редкостью.

Моделирование имеет большое значение, особенно в редких или опасных сценариях, но разрыв между результатами моделирования и реальными данными остается значительным для динамики контакта, податливости материалов и шума датчиков. Наиболее эффективные конвейеры обучения физического ИИ сочетают синтетические и реальные данные, а не полагаются только на один из них.

Два момента. Во-первых, необходимо определить, какие производственные сбои вызваны контактом — проскальзывание, деформация, несоосность, — поскольку именно эти сбои можно исправить одними данными. Во-вторых, следует разработать целевую программу сбора данных, которая добавит недостающие модальности (тактильные ощущения, сила, проприоцепция) к конкретным задачам, где это позволит добиться существенных результатов, вместо того чтобы пытаться воссоздать весь набор данных сразу.

Понравилась статья? Подпишитесь на Шаипа в LinkedIn, чтобы получать больше новостей.

Социальная Поделиться