Kaynaklar
Yapay zekâ sanatında öne geç
Haftanın en iyi yapay zekâ ve yapay zekâ sanatı haberlerini gelen kutuna al — seçkin, kısa ve ücretsiz.
Ücretsiz. İstediğin zaman çık.

Haftanın en iyi yapay zekâ ve yapay zekâ sanatı haberlerini gelen kutuna al — seçkin, kısa ve ücretsiz.
Ücretsiz. İstediğin zaman çık.
Sınır fiziksel yapay zeka laboratuvarları kullanılabilir video verilerinin tükenmekte olduğunu görüyor ve şimdi yeni nesil somutlaşmış yapay zeka modellerini eğitmek için çoklu kamera düzenekleri, yoğun insan açıklaması ve deneysel beyin dalgası (EEG) okumalarına yöneliyor — bu değişim, fiziksel yapay zekanın veri taleplerinin bugün çoğu yaratıcının kullandığı görüntü ve metin modellerinden ne kadar farklı olduğunu ortaya koyuyor.
Temel problem, TechCrunch'ın bildirdiği gibi, perspektif. Tek bir kamera bir görevin tek bakış açısını yakalar — örneğin çamaşır katlayan bir insan — ancak bu görevi öğrenen bir robotun eylemi aynı anda birden fazla açıdan anlaması, üç boyutlu uzayda her nesnenin nerede olduğuna dair kesin uzamsal verilerle birlikte gerekir. Standart tüketici videosu, yüksek çözünürlükte bile olsa, bu derinlik bilgisini çöker. Laboratuvarlar şimdi basit ev işlerini bile kaydetmek için çoklu kamera yakalama düzenekleri ve derinlik sensörleri kullanıyor, ardından insan açıklayıcılarına her çerçeveyi nesne konumları, el pozları ve eylem etiketleriyle etiketlemeleri için ödeme yapıyor.
Bu açıklama yükü muazzam. Araştırmacılar, kullanılabilir fiziksel yapay zeka eğitim verisinin tek bir saatini üretme maliyetini, eşdeğer bir saatlik metin veya görüntü verisinden kat kat daha yüksek olarak tanımlıyor. Bağlam için, Charmloop'un görüntü üreticisi gibi platformlardaki araçların arkasındaki difüzyon modelleri, web'den kazınmış milyarlarca görüntü-metin çifti üzerinde eğitildi — yasal olarak tartışmalı olsa da en azından bol olan bir kaynak. Fiziksel yapay zekanın eşdeğer bir veri akışı yok.
Daha spekülatif gelişme EEG entegrasyonu. Fikir: bir insan göstericiye beyin dalgası sensörü takıp fiziksel eylemlerinin yanında sinirsel sinyallerini kaydetmek. Hipotez şu: EEG verisi niyeti kodluyor — bir kişinin elini hareket ettirmeden önce bir nesneyi almaya karar verdiği an — modele yalnızca hareket yakalamadan daha zengin bir sinyal veriyor. Birkaç laboratuvar küçük pilot çalışmalar yürütüyor, ancak henüz hiçbir sınır modeli EEG verisi üzerinde ölçekte eğitilmedi. Teknik hala üretim boru hattından çok araştırma merakına daha yakın.
İzlemeye değer kılan şey açıklama açısı. Fiziksel yapay zeka eğitiminde kalıcı bir problem belirsizlik: bir insan görev ortasında durakladığında, nesne garip olduğu için mi tereddüt etti, fikrini değiştirdiği için mi, yoksa dikkati dağıldığı için mi? Kamera görüntüleri bunu cevaplayamaz. Beyin dalgası verisi, teorik olarak, yapabilir. EEG açıklaması güvenilir olduğunu kanıtlarsa, yetkin bir fiziksel model eğitmek için gereken görüntü miktarını dramatik olarak azaltabilir — çünkü her saniye veri daha fazla sinyal taşıyacak.
Bugün görüntü ve video üretimi ile çalışan yaratıcılar için, doğrudan pratik etki dolaylı ama gerçek. Fiziksel yapay zeka için inşa edilen açıklama boru hatları — görsel veriye eklenmiş yoğun, yapılandırılmış, anlamsal olarak zengin etiketler — üretken video modellerini nedensellik ve fiziği anlamada daha iyi kılan aynı türden yapılandırılmış veri. Zengin açıklamalı fiziksel dünya görüntüleri üzerinde eğitilen modeller daha tutarlı hareket, daha makul nesne etkileşimleri ve yapay zeka videosunu hala rahatsız eden yüzen uzuv yapay eserlerinin daha azını üretme eğiliminde.
Bugün fiziksel yapay zeka laboratuvarlarında rafine edilen teknikler, birkaç yıl içinde üretken model eğitimine geçme geçmişine sahip. Gerçekçi hareket ve uzamsal tutarlılık için ipucu verme kılavuzlarını takip eden yaratıcılar, muhtemelen doğrudan bir robot veri setine dokunmadan bu yukarı akış çalışmasından faydalanacak.
Veri darboğazı aynı zamanda yapay zeka yeteneğindeki kolay kazanımların — bol web verisine karşı hesaplama ölçeklendirmenin — sonsuz olmadığının bir hatırlatıcısı. Fiziksel yapay zeka bu duvara ilk çarpıyor, ancak üretken görüntü ve video modelleri çok geride değil. Şimdi yeni veri toplama yöntemlerine yatırım yapan laboratuvarlar, nereye düşerse düşsün bir sonraki yetenek sıçraması için pozisyon alıyor.