Kaynaklar
Yapay zekâ sanatında öne geç
Haftanın en iyi yapay zekâ ve yapay zekâ sanatı haberlerini gelen kutuna al — seçkin, kısa ve ücretsiz.

Theo yapay zekâ haberlerini bu akşam deneyebileceğiniz şeylere dönüştürür.
Haftanın en iyi yapay zekâ ve yapay zekâ sanatı haberlerini gelen kutuna al — seçkin, kısa ve ücretsiz.
Ücretsiz. İstediğin zaman çık.
Bir arkadaşını seç ve bu haber hakkındaki görüşünü öğren
Bir Anthropic araştırmacısı, yapay zekada otomatik öz-iyileştirmeyi kamuoyu önünde sergiledi: belirli hizalama sorunlarını hedef alan 10 kıyaslama testi verildiğinde, otomatik sistemler modelin genel performansını düşürmeden her birinde başarıyı artırdı.
TechCrunch'a göre, araştırmacının sistemi, bir modelin amaçlanan yönergelere aykırı davrandığı belirli başarısızlık biçimleri olan on ayrı hizalama sorununu hedef aldı ve her birine karşı otomatik iyileştirme döngüleri çalıştırdı. Sonuç: onunun tamamı iyileşti ve modelin temel performansı sabit kaldı. İkinci kısım, daha zorlu mühendislik sorunudur. Bir davranışı düzeltirken sessiz sedasız başka birini bozan otomatik ince ayar, iyi belgelenmiş bir tuzaktır; gerileme olmadan on hedefi temiz biçimde vurmak anlamlı bir sinyaldir.
Demo, kullanıma alınmış bir özellik değil, bir araştırma önizlemesidir. Ancak çizdiği mekanizma — davranışsal boşlukları tespit eden, iyileştirme döngüleri çalıştıran ve genel kapasite temel çizgisine göre doğrulayan bir ardışık düzen — model güncellemelerini sonunda daha hızlı ve daha cerrahi hale getirebilecek tam da bu mimaridir.
Şu anda, bir modelin kalıcı bir tuhaflığı olduğunda — örneğin sürekli elleri bozuyor, arka planlarla ilgili negatif istemleri görmezden geliyor ya da uzun karakter sayfalarında stilden sapıyor — geçici çözüm istemlerinizde yaşıyor. Token ekliyorsunuz, ControlNet yığınları oluşturuyorsunuz, seed'leri toplu test ediyorsunuz. Bu sürtüşme gerçektir. Davranışsal öz-iyileştirme, laboratuvarların düzenli bir tempoda çalıştırabileceği bir şeye olgunlaşırsa, bu geçici çözümlerin bir kısmı model sürümleri arasında sessizce ortadan kalkabilir.
Pratik endişe ise madalyonun öbür yüzüdür: etrafında bir iş akışı kurduğunuz bir model sürekli olarak sessizce öz-düzeltme yapıyorsa, geçen Salı işe yarayan istem gelecek Salı farklı davranabilir. Katalogdaki belirli bir modeli kullanarak düzinelerce üretimde tutarlı bir yüz elde etmiş bir karakter sanatçısının istikrara ihtiyacı vardır, sürpriz güncellemelere değil. Anthropic demosu bu gerilimi çözmüyor — onu keskinleştiriyor.
Şimdilik, anlık iş akışı çıkarımı eylemden çok farkındalıktır. Yeniden üretilebilir çıktılara bağımlı uzun vadeli projeler yürütüyorsanız, çalışan istemlerinizi ve seed'lerinizi dikkatlice belgeleyin. Öz-iyileştiren modeller hâlâ araştırma aşamasında bir kavramdır, ancak seyahat yönü açıktır.
Bu demoda yer alan on kıyaslama testi, hizalama sorunlarını hedef aldı — modelin amaçlanan yönergelerine aykırı bir şey yaptığı durumlar. Bu çerçeveleme önemlidir. Hizalamaya yönelik öz-iyileştirme, ham kapasiteye yönelik öz-iyileştirmeden farklıdır; amaç, modeli daha akıllı veya daha hızlı yapmak değil, davranışsal düzeltmedir.
Bu, izlemeye değer daha geniş bir örüntüyle bağlantılıdır: Yapay zeka laboratuvarları, yalnızca insan incelemesine güvenmek yerine, model yaşam döngüsünün kendisine giderek daha fazla otomatik değerlendirme ve düzeltme yerleştiriyor. Bu, otomatik model davranışının amaçlanan sınırların çok dışına çıktığı OpenAI'nin Hugging Face'teki sahte model ihlali gibi olayları takip eden herkes için ilgili bir bağlamdır. Dikkatli biçimde yapılan otomatik öz-düzeltme, bu tür sorunlara teknik bir yanıttır — ancak hedef davranışları kimin tanımladığı ve bu tanımların nasıl geliştiğine dair yeni sorular da doğurmaktadır.
Anthropologic araştırmacısının demosu tek bir veri noktasıdır, ancak somut bir veri noktasıdır. On kıyaslama testi, sıfır gerileme. Bir sonraki soru, ardışık düzenin nasıl ölçekleneceği — ve davranışsal hedeflerin bu modeller üzerine inşa eden kişiler için okunabilir kalıp kalmayacağıdır.
Model davranışı değişimlerinin önünde kalmak isteyen içerik üreticileri, yeni model davranışlarının pratik üretim iş akışlarında ortaya çıktıkça belgelendiği Charmloop rehberleri aracılığıyla kapasite değişikliklerini takip edebilir.