Источники
Будь в курсе ИИ-арта
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.

Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.
Передовые лаборатории физического ИИ исчерпывают пригодные видеоданные и теперь обращаются к многокамерным установкам, плотной человеческой аннотации и экспериментальным считываниям мозговых волн (ЭЭГ) для обучения следующего поколения воплощенных моделей ИИ — сдвиг, который показывает, насколько отличаются требования к данным физического ИИ от моделей изображений и текста, которые большинство создателей используют сегодня.
Основная проблема, как сообщает TechCrunch, — это перспектива. Одна камера захватывает одну точку зрения на задачу — скажем, человек складывает белье — но робот, изучающий эту задачу, должен понимать действие с нескольких углов одновременно, с точными пространственными данными о том, где каждый объект находится в трехмерном пространстве. Стандартное потребительское видео, даже в высоком разрешении, сжимает эту информацию о глубине. Лаборатории теперь развертывают многокамерные установки захвата и датчики глубины для записи даже простых домашних задач, затем платят человеческим аннотаторам за разметку каждого кадра с позициями объектов, позами рук и метками действий.
Эта нагрузка аннотации огромна. Исследователи описывают стоимость производства одного часа пригодных данных для обучения физического ИИ как на порядки выше, чем эквивалентный час текстовых или изображенческих данных. Для контекста, диффузионные модели за инструментами на платформах вроде генератора изображений Charmloop были обучены на миллиардах пар изображение-текст, собранных из интернета — запас, который, хотя и юридически спорный, был по крайней мере обильным. У физического ИИ нет эквивалентного потока.
Более спекулятивное развитие — интеграция ЭЭГ. Идея: прикрепить датчик мозговых волн к человеку-демонстратору и записывать их нейронные сигналы вместе с их физическими действиями. Гипотеза заключается в том, что данные ЭЭГ кодируют намерение — момент, когда человек решает взять объект до того, как его рука движется — давая модели более богатый сигнал, чем только захват движения. Несколько лабораторий проводят небольшие пилотные проекты, хотя ни одна передовая модель еще не была обучена в масштабе на данных ЭЭГ. Техника все еще ближе к исследовательскому любопытству, чем к производственному конвейеру.
Что делает это достойным наблюдения — это аспект аннотации. Одна постоянная проблема в обучении физического ИИ — неоднозначность: когда человек останавливается посреди задачи, колебался ли он, потому что объект был неудобным, потому что он передумал, или потому что отвлекся? Кадры с камеры не могут ответить на это. Данные мозговых волн, теоретически, могут. Если аннотация ЭЭГ окажется надежной, она могла бы драматически сократить количество кадров, необходимых для обучения компетентной физической модели — потому что каждая секунда данных несла бы больше сигнала.
Для создателей, работающих с генерацией изображений и видео сегодня, непосредственное практическое воздействие косвенное, но реальное. Конвейеры аннотации, строящиеся для физического ИИ — плотные, структурированные, семантически богатые метки, прикрепленные к визуальным данным — это тот же тип структурированных данных, который делает генеративные видеомодели лучше в понимании причинности и физики. Модели, обученные на богато аннотированных кадрах физического мира, склонны производить более связное движение, более правдоподобные взаимодействия объектов и меньше артефактов плавающих конечностей, которые все еще мучают видео ИИ.
Техники, совершенствуемые в лабораториях физического ИИ сегодня, имеют историю миграции в обучение генеративных моделей в течение нескольких лет. Создатели, которые следуют руководствам по промптингу для реалистичного движения и пространственной связности, вероятно, выиграют от этой восходящей работы, никогда не касаясь набора данных роботов напрямую.
Узкое место данных также напоминание, что легкие достижения в способностях ИИ — масштабирование вычислений против обильных веб-данных — не бесконечны. Физический ИИ первым ударяется об эту стену, но генеративные модели изображений и видео недалеко позади. Лаборатории, инвестирующие в новый сбор данных сейчас, позиционируются для следующего скачка способностей, где бы он ни приземлился.