Егоцентричний набір даних

Що таке егоцентричний набір даних? Посібник з робототехніки та втіленого штучного інтелекту

Егоцентричний набір даних — це структурована колекція відеозаписів від першої особи та записів датчиків, знятих з камери, встановленої на голові, грудях або зап'ясті, які використовуються для навчання робототехніки та втілених систем штучного інтелекту тому, як люди бачать, рухаються та діють. Це найближча відповідність тому, що бачитиме вбудована камера робота під час роботи, саме тому він став основоположним для навчання моделі зору-мовлення-дії (VLA).

Робот, навчений лише на лабораторних кадрах, часто виходить з ладу в перший же день після виїзду з лабораторії. Причиною рідко є модель. Річ у тім, що це дані.

Більшість навчальних відео знімається зі штатива або стельової камери. Такі кадри показують кімнату, але не роботу. Не руку. Не об'єкт. Не той самий кут, який побачить вбудована камера робота, коли той фактично підніме чашку або відкриє шухляду. Саме цю прогалину і створено егоцентричний набір даних, щоб заповнити.

У цьому посібнику розповідається, що таке егоцентричний набір даних, чому дані від першої особи стали основою сучасної робототехніки та втіленого штучного інтелекту, як насправді виглядають якісні дані та на що команди повинні звертати увагу перед ліцензуванням або введенням в експлуатацію такого набору.

Що таке егоцентричний набір даних?

Егоцентричний набір даних — це структурована колекція відео- та сенсорних даних, знятих з точки зору першої особи. Камера розташована на голові, грудях або зап'ясті людини, яка виконує завдання, — іноді на самому роботу, — тому запис показує світ саме так, як його бачить актор.

«Егоцентричний» просто означає «від себе» . Камера від третьої особи показує, що відбувається в кімнаті. Егоцентрична камера показує, що роблять руки, очі та інструменти актора під час цього. Ця різниця здається незначною. Для команд робототехніки це все.

Більшість сучасних егоцентричних наборів даних поєднують відео з додатковими сигналами — глибиною, рухом, аудіо, а іноді й відстеженням очей чи рук — тому один момент можна вивчати з кількох точок зору одночасно.

[Читайте також: Стратегія даних для навчання роботів ]

Чому егоцентричні дані важливі для робототехніки та втіленого штучного інтелекту

Роботи зазнають невдачі в реальному світі з невеликого переліку причин. Неправильна точка зору є однією з головних.

Егоцентричні дані важливі для робототехніки та втіленого штучного інтелекту Вбудована камера робота бачить світ з того місця, де він стоїть. Якщо ви тренуєте його на відео з видом зверху або збоку, модель повинна щоразу долати прогалину, коли вона діє — перетворюючи сцену від третьої особи на рішення від першої особи. Саме в цій прогалині трапляються помилки: нечіткий хват, пропущена точка контакту, рука, яка занадто рано закриває такт.

Навчання на даних від першої особи усуває цей крок перетворення. Модель навчається з того ж ракурсу, який використовуватиме пізніше. Нещодавні дослідження робототехнічного навчання показали, що політики, навчені на даних від першої особи, можуть перевершувати політики, навчені від третьої особи, на 15–30% у завданнях маніпуляцій, залежно від типу завдання. Результат проявляється в самій роботі: чіткіші захоплення, кращий таймінг рук і очей, розумніші реакції на безлад і часткові ракурси.

Саме тому дані від першої особи лежать в основі систем фізичного штучного інтелекту та нової хвилі моделей «візуалізація-мова-дія» — систем, які приймають візуальний вхід та усну чи письмову інструкцію, а потім виводять реальну дію у фізичному світі.

Усередині високоякісного егоцентричного набору даних

Одного лише необробленого відео недостатньо. Високоякісний егоцентричний збір даних поєднує відео від першої особи з кількома іншими сигналами:

  • Синхронізоване відео з гарною роздільною здатністю, часто з кількох кутів (голова, груди або зап'ястя)
  • Дані глибини що допомагає моделі зрозуміти, як далеко знаходиться об'єкт, а не лише де він знаходиться в кадрі
  • Дані датчика руху (IMU) який відстежує рухи голови та тіла кадр за кадром
  • аудіо — що містить дивовижну кількість контексту, як-от ніж на дошці чи людина, яка розмовляє поруч
  • Відстеження рук або очей для завдань, де важливі увага та захоплення

Загвоздка в тому, що все це має бути вирівняно з точністю до мілісекунди. Якщо потік глибини відстає на чверть секунди від відео, модель неправильно визначає причинно-наслідковий зв'язок. Надійна егоцентрична анотація даних, що доповнює добре відкалібрований запис, перетворює необроблені записи на дані, готові для навчання.

Лабораторні знімки проти зйомки в реальному світі

Це допомагає уявити собі інший тип навчальної проблеми.

Уявіть, що ви навчаєте когось їздити на велосипеді, показуючи йому лише відео, зняте з дрона зверху. Він бачитиме велосипед, дорогу та стежку. Він не бачитиме хитання керма, того, як очі сканують попереду на поворотах, або як рухається тіло перед поворотом. Технічно він знатиме, як виглядає їзда на велосипеді . Він не знатиме, як це робити.

Лабораторні дані мають ту саму проблему в масштабі. Чисте освітлення, один об'єкт на чистому столі, одне завдання на кліп — це охайно, але це не той світ, у який відправляється робот. Моделі, навчені на лабораторних матеріалах, часто працюють у перший день і руйнуються на тридцятий, коли мерехтить освітлення, двоє людей перетинаються або три SKU лежать на одній полиці.

Егоцентричне захоплення в реальному світі повертає шум. Саме цей шум змушує моделі витримувати після розгортання.

[Читайте також: Як моделі VLA використовують егоцентричне відео ]

Чотири шари егоцентричного стеку наборів даних

Різні проблеми потребують різних шарів даних. Набір даних, створений для одного завдання, рідко добре охоплює інші. Ось простий спосіб уявити шари, які більшість фізичних команд ШІ об'єднують для створення повного втіленого набору даних ШІ:

шар Що воно фіксує Що це тренує
Людське розуміння Реальна людська діяльність у повсякденному середовищі Базове сприйняття — як люди рухаються, тримають предмети, перемикаються між завданнями
Виконання завдання Дані маніпуляцій: траєкторії, захоплення, стани суглобів Керування рухами робота та повторення навичок
Інструкція, що дотримується Зір + усні або письмові інструкції + дії Моделі «візуалізація-мова-дія», що перетворюють інструкцію на реальну дію
Завершення робочого процесу Довгі, багатоетапні дані завдань з обробкою винятків Довгострокове мислення та відновлення, коли щось йде не так

Більшість виробничих команд використовують більше одного рівня. Наприклад, гуманоїд, якому потрібно завантажити посудомийну машину, використовує щонайменше три: демонстрації за участю людей, точні маніпуляції та покрокову структуру завдань.

Де егоцентричні дані стимулюють реальний попит

Егоцентричні дані стимулюють реальний попит Уявіть собі склад середнього розміру, де минулого кварталу запустили робота-підбирача. Навчений на акуратних лабораторних знімках, він чудово впорався з першим тижнем. Потім стався сезонний сплеск. Коробки, складені під дивними кутами, мерехтіння люмінесцентних ламп, двоє робітників, що перетинають прохід. Робот зупинився — не тому, що модель зламалася, а тому, що ніщо в його навчанні не виглядало як справжня зміна.

Такий розрив спостерігається в різних галузях, і саме тому попит на дані навчання від першої особи зростає в деяких конкретних місцях:

  • Гуманоїдні та домашні роботи. Приготування їжі, прибирання, розкладання продуктів. Завдання, які здаються легкими, поки ви не побачите, як їх виконує робот.
  • Автономна мобільність. Керування, поведінка в салоні, доставка на останній милі. Зйомка від першої особи скорочує розрив між симуляцією та реальними вулицями.
  • Промислові егоцентричні набори даних. Заводські цехи, складальні лінії, нафтогазові майданчики — використовуються для навчання виявленню небезпечних ситуацій, ергономічному відстеженню та робототехніці, що допомагає працівникам.
  • Хірургічні відеодані від першої особи. Захоплення процедур за допомогою камер, встановлених на голові хірургів, що використовуються для навчання моделей асистентів та медичних систем доповненої реальності.
  • Егоцентричні дані про поведінку споживачів у роздрібній торгівлі. Носимі відеозаписи покупців у реальних магазинах, що використовуються для вивчення уваги, навігації та прийняття рішень на полиці.

Різні галузі, одна й та сама базова потреба: дані, які виглядають як робота, а не лабораторія.

Що робить егоцентричний набір даних готовим до моделювання?

Незалежно від того, чи створюєте ви власні дані, чи оцінюєте егоцентричних постачальників даних, п'ять речей відрізняють дані дослідницького рівня від даних, які добре працюють у виробництві:

Робить егоцентричний набір даних готовим до моделювання

  1. Глибина анотації егоцентричних даних. Не просто обмежувальні рамки. Пози рук, стани об'єктів, кроки дії та намір — усе вирівняно по правильному кадру.
  2. Калібрування датчика. Синхронізуйте час між відео, глибиною, аудіо та рухом, щоб модель бачила один цілісний момент, а не п'ять дрейфуючих потоків.
  3. Покриття граничних випадків. Слабке освітлення, перекриття, скупчення людей, рідкісні події. Випадки, коли лабораторні дані непомітно залишають прогалини. Опитування покупців у галузі постійно ставлять якість анотацій та покриття граничних випадків як два головні критерії під час оцінки партнерів з обробки даних.
  4. Згода та дотримання вимог. Відео від першої особи є конфіденційним за визначенням. Набори даних потребують задокументованої згоди учасників, анонімізації обличчя, де це необхідно, та відповідності таким фреймворкам, як GDPR та HIPAA. Контроль постачальників, такий як ISO 27001 та SOC 2 Type II, додає процедурний рівень, якого очікують юридичні команди підприємств.
  5. Готовність від симуляції до реальності. Відеозаписи з реального світу, які чітко поєднуються із синтетичними даними, дозволяють командам масштабувати навчання, не втрачаючи основи, яка робить моделі надійними.

Якісний збір даних – це та частина, яку найважче виправити пізніше. Зробіть це безпосередньо у джерелі, і решта процесу стане простішою.

Ключові вивезення

  • Егоцентричний набір даних — це відео від першої особи та дані датчиків. — знято з точки зору самого актора — використовується для навчання робототехніки та втілених моделей штучного інтелекту так, як вони насправді бачитимуть світ у розгортанні.
  • Дані, отримані від першої особи, заповнюють розрив між сприйняттям та дією що призводить до того, що навчені в лабораторії роботи виходять з ладу під час реальних змін.
  • Якісні егоцентричні дані є мультимодальними — відео, глибина, аудіо, рух та відстеження — синхронізовані з точністю до мілісекунди.
  • Готовність до виробництва означає більше, ніж просто анотації — це означає охоплення граничних випадків, реальні середовища, готовність до симуляції та документований контроль відповідності вимогам.

Як Шайп може допомогти

Якщо ваша команда пройшла етап «чи потрібні нам егоцентричні дані» та перейшла до питання «як нам їх насправді отримати», саме тут і знадобиться Шайп.

Ми запускаємо повний конвеєр даних, що стоять за фізичними програмами штучного інтелекту — захоплення від першої особи в реальних середовищах, анотації рівня VLA, синтетичні дані, RLHF та оціночні тести в рамках одного проекту. Декілька подробиць:

  • Зйомка в реальному світі, а не лабораторні кадри. Шоломні камери, розумні окуляри та портативні пристрої на кухнях, складах, фабриках, у медичних закладах та магазинах.
  • Мультисенсорна синхронізація. Відео, IMU, LiDAR, аудіо та глибина — калібровані та вирівняні за часом до мілісекунди.
  • Анотація, створена для навчання VLA. Об'єкти, дії, взаємодія рук і об'єктів, намір та просторовий контекст.
  • Підтримка як від симулятора до реального. Синтетична генерація та конвеєри Real2Sim, що розширюють покриття без втрати реального заземлення.
  • Відповідність з першого дня. ISO 27001, SOC 2 Type II, готовий до HIPAA та GDPR — зі збором даних на основі попередньої згоди та готовим до аудиту походженням даних.

Якщо це відповідає напрямку розвитку вашої програми фізичного штучного інтелекту, ми будемо раді розглянути пілотний проект.

Висновок

Егоцентричний набір даних – це не просто відео від першої особи. Це структурований спосіб навчання машин бачити та діяти так само, як люди. Для команд, що займаються робототехнікою та втіленим штучним інтелектом, це різниця між моделлю, яка добре демонструється, та тією, яка постачається. Незалежно від того, чи метою є гуманоїди, автономія чи розумні фабрики, егоцентричні дані для розробки робототехніки та штучного інтелекту стають основним шаром кожної серйозної стратегії втіленого набору даних ШІ, а не необов'язковим. Команди, які роблять це правильно, – це ті, хто розглядає дані – збір, анотацію, перевірку та відповідність – як основну частину системи, а не як крок до цього.

Це структурований набір відеозаписів та записів з датчиків, знятих від першої особи — зазвичай з камери, яку носять на голові, грудях або зап'ясті — які використовуються для навчання систем штучного інтелекту тому, як люди бачать та виконують завдання.

Відео від третьої особи показує сцену з точки зору стороннього спостерігача. Роботи діють з власної точки зору. Навчання на даних від першої особи скорочує розрив між тим, що вивчає модель, і тим, що робот насправді бачить під час роботи, із задокументованим підвищенням точності на 15–30% у маніпуляційних завданнях.

RGB-камери, датчики глибини, датчики руху (IMU) та аудіо. Багато систем також додають відстеження рук або очей. Для автономної робототехніки іноді LiDAR використовується для просторового картографування.

Моделі VLA приймають візуальний вхід та мовну інструкцію, а потім виводять дію. Егоцентричні дані надають їм узгоджені триплети вигляду, інструкції та результату, необхідні для надійного вивчення цього відображення.

Три речі: вища якість анотацій, ширше охоплення реальних умов, а не лабораторних, та документований список відповідності, що охоплює згоду, конфіденційність та походження даних, готових до аудиту.

Сподобалася ця стаття? Слідкуйте за Shaip у LinkedIn, щоб отримувати більше оновлень.

Соціальна Поділитися