Джерела
Подивись у дії
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталог
Айріс пише про те, де ШІ-мистецтво зустрічається з культурою: стиль, авторство та образи, які мають значення.
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталогОбери компаньйона і дізнайся його думку про цю історію
AMD купує World Labs — стартап у сфері просторового ШІ, співзасновницею якого є піонерка Stanford AI д-р Фей-Фей Лі, — за 8,2 мільярда доларів у рамках угоди з повною оплатою акціями, яку очікують закрити до кінця 2025 року. Лі приєднається до AMD як виконавчий віцепрезидент і головний науковець — крок, що сигналізує про намір AMD конкурувати з Nvidia не лише на рівні кремнію, а й на рівні фундаментальних досліджень, які визначають, як моделі ШІ розуміють і генерують тривимірний простір.
World Labs не будував чергову велику мовну модель. Основні дослідження компанії спрямовані на просторовий інтелект — здатність ШІ будувати зв'язний тривимірний світ із візуальних даних і міркувати про нього, а не сприймати зображення як плоску сітку пікселів. Ця відмінність надзвичайно важлива для всіх, хто генерує зображення або сцени за допомогою інструментів ШІ.
Сучасні дифузійні моделі створюють зображення, які на перший погляд виглядають просторово правдоподібно, але розсипаються під пильним поглядом: руки проходять крізь предмети, тіні падають не в той бік, архітектура викривляється по краях кадру. Це не галюцинації у розумінні мовних моделей — це збої геометричного мислення. Модель, заснована на просторовому інтелекті, розуміла б, що ніжка стільця знаходиться за столом, а не зливається з ним, — і це обмеження поширювалося б на кожен піксель результату. Естетичний наслідок — зображення, які тримаються структурно, як фотографія, а не просто нагадують фотографії.
Для генерації відео зокрема просторова прив'язка — це різниця між сценою, яка відчувається як місце, і послідовністю кадрів, що просто мають спільну колірну палітру. Творці, які працюють з інструментами ШІ для відео та анімації, найгостріше відчувають цю прогалину сьогодні — саме через неї згенеровані рухи камери досі виглядають гумовими, а постійність об'єктів між монтажними склейками залишається невирішеною проблемою.
За даними Ars Technica, угода оцінюється в 8,2 мільярда доларів — цифра, що відображає не лише дослідницький портфель World Labs, а й стратегічну цінність самої Лі. Як науковець, яка разом із колегами створила ImageNet — набір даних, що каталізував революцію глибокого навчання в комп'ютерному зорі, — Лі має інституційний авторитет, який не можна купити лише за гроші. AMD одночасно купує напрям досліджень і репутацію.
Домінування Nvidia в обчисленнях для ШІ завжди трималося на двох стовпах: GPU-апаратному забезпеченні та CUDA — програмній екосистемі, що прив'язує розробників. Але тихо виріс третій стовп — інвестиції Nvidia в дослідницькі партнерства та придбання, що утримують її апаратне забезпечення в центрі розробки передових моделей. AMD вже має апаратне забезпечення; їй бракувало дослідницького тяжіння. World Labs і Лі змінюють цей розрахунок.
«Моделі світу — це наступний рубіж ШІ: системи, які не просто розпізнають світ, а розуміють і симулюють його.»
— Dr. Fei-Fei Li
Практична вигода для творців не є негайною. Угода ще не закрита, а інтеграція просторового ШІ дослідницького рівня у виробничі конвеєри генерації зображень займає роки, а не квартали. Але напрям зрозумілий: наступне покоління моделей дедалі більше оцінюватиметься за геометричною зв'язністю та узгодженістю сцен, а не лише за поверхневою текстурою і стилем.
Творці, які вже зараз просувають поточні інструменти до архітектурної візуалізації, генерації ігрових ресурсів або узгодженості між кадрами — типи робочих процесів, досліджуваних у посібниках Charmloop, — першими відчують, як ця прогалина закривається. Моделі в каталозі Charmloop врешті-решт відобразять цей зсув, коли просторове мислення перейде від дослідницької цікавості до навчальної мети.
Наразі придбання є сигналом про те, куди рухається конвеєр від апаратного забезпечення до моделей. AMD щойно зробила дуже велику ставку на те, що майбутнє ШІ-зображень є тривимірним, — і що науковець, яка навчила машини бачити, є найкращою людиною, щоб це довести.