Джерела
Будь на крок попереду у ШІ-арті
Отримуй на пошту головні історії тижня про ШІ та ШІ-арт — відібрані, стислі, безкоштовно.
Безкоштовно. Відписатися можна будь-коли.

Отримуй на пошту головні історії тижня про ШІ та ШІ-арт — відібрані, стислі, безкоштовно.
Безкоштовно. Відписатися можна будь-коли.
Передові лабораторії фізичного ШІ вичерпують придатні відеодані й тепер звертаються до багатокамерних установок, щільної анотації людьми та експериментального зчитування мозкових хвиль (ЕЕГ) для навчання нового покоління втілених моделей ШІ — зрушення, яке наочно демонструє, наскільки вимоги до даних фізичного ШІ відрізняються від тих, що висувають моделі зображень і тексту, якими більшість творців користується сьогодні.
Основна проблема, як повідомляє TechCrunch, — це перспектива. Одна камера фіксує лише один ракурс завдання — скажімо, людина складає білизну — але робот, який навчається цього завдання, має розуміти дію одночасно з кількох кутів, маючи точні просторові дані про розташування кожного об'єкта у тривимірному просторі. Стандартне споживче відео, навіть у високій роздільній здатності, втрачає цю інформацію про глибину. Лабораторії вже розгортають багатокамерні знімальні установки та датчики глибини для запису навіть простих побутових завдань, а потім платять людям-анотаторам за розмітку кожного кадру з позиціями об'єктів, позами рук і мітками дій.
Навантаження від анотації є колосальним. Дослідники описують вартість виробництва однієї години придатних навчальних даних для фізичного ШІ як на порядки вищу, ніж еквівалентна година текстових або графічних даних. Для порівняння: дифузійні моделі, що лежать в основі інструментів на таких платформах, як генератор зображень Charmloop, навчалися на мільярдах пар зображення-текст, зібраних з мережі — запас, який, хоча й є юридично спірним, принаймні був рясним. У фізичного ШІ немає аналогічного невичерпного джерела.
Більш спекулятивним напрямком є інтеграція ЕЕГ. Ідея така: надягти датчик мозкових хвиль на людину-демонстратора і записувати її нейронні сигнали паралельно з фізичними діями. Гіпотеза полягає в тому, що дані ЕЕГ кодують намір — момент, коли людина вирішує підняти предмет ще до того, як рука рухається, — надаючи моделі більш насичений сигнал, ніж лише захоплення руху. Кілька лабораторій проводять невеликі пілотні проєкти, хоча жодна передова модель ще не навчалася у великому масштабі на даних ЕЕГ. Техніка поки що ближча до дослідницького курйозу, ніж до виробничого конвеєра.
Цінність цього напрямку полягає в аспекті анотації. Одна з постійних проблем у навчанні фізичного ШІ — неоднозначність: коли людина робить паузу посеред завдання, чи вона зупинилася через незручний предмет, через зміну рішення, чи через відволікання? Відеозапис не може дати відповідь. Дані мозкових хвиль, теоретично, можуть. Якщо ЕЕГ-анотація виявиться надійною, вона може суттєво скоротити обсяг відеозаписів, необхідних для навчання компетентної фізичної моделі, — адже кожна секунда даних нестиме більше корисного сигналу.
Для творців, які сьогодні працюють із генерацією зображень і відео, безпосередній практичний вплив є непрямим, але реальним. Конвеєри анотації, що будуються для фізичного ШІ, — щільні, структуровані, семантично насичені мітки, прикріплені до візуальних даних, — це той самий тип структурованих даних, який робить генеративні відеомоделі кращими у розумінні причинно-наслідкових зв'язків і фізики. Моделі, навчені на багато анотованих записах реального світу, як правило, відтворюють більш зв'язний рух, більш правдоподібну взаємодію об'єктів і менше артефактів у вигляді «плаваючих кінцівок», які досі переслідують відео від ШІ.
Техніки, що вдосконалюються в лабораторіях фізичного ШІ сьогодні, мають підтверджену тенденцію мігрувати у навчання генеративних моделей протягом кількох років. Творці, які дотримуються посібників із промптингу для реалістичного руху та просторової зв'язності, швидше за все, отримають вигоду від цієї роботи на вищому рівні, жодного разу не торкнувшись набору даних про роботів безпосередньо.
Дефіцит даних також нагадує, що легкі здобутки у розвитку можливостей ШІ — масштабування обчислень на тлі рясних веб-даних — не є нескінченними. Фізичний ШІ першим натикається на цю стіну, але генеративні моделі зображень і відео відстають ненабагато. Лабораторії, що вже зараз інвестують у нові методи збору даних, позиціонують себе для наступного стрибка у можливостях — де б він не відбувся.