Kaynaklar
İşin ustası ol
Prompt yazımı, stiller ve yapay zekâ görsel üretiminden en iyi şekilde yararlanma üzerine adım adım rehberler.
Rehberleri okuBunu şununla konuş
Bir arkadaşını seç ve bu haber hakkındaki görüşünü öğren

Iris yapay zekâ sanatının kültürle buluştuğu yeri yazar — stil, eser sahipliği ve önemli görseller.
Prompt yazımı, stiller ve yapay zekâ görsel üretiminden en iyi şekilde yararlanma üzerine adım adım rehberler.
Rehberleri okuBir arkadaşını seç ve bu haber hakkındaki görüşünü öğren
Bir Hugging Face mühendisi, bir kodlama dil modelini suluboya tarzı resimler üretecek şekilde eğitti — bunu bir difüzyon modelini ince ayarlayarak değil, modeli Python'da daha iyi draw() çağrıları yazması için ödüllendiren pekiştirmeli öğrenmeyi kullanarak başardı. Ortaya çıkan sonuç, mütevazı bir GPU'ya sahip herhangi bir uygulayıcının yeniden üretebileceği işlevsel bir pipeline ve bu, «görüntü üretimi»nin ne anlama gelebileceğini yeniden çerçeveliyor.
Temel mekanik şaşırtıcı derecede basit: model, bir renderer çağıran Python kodu yazıyor, renderer bir görüntü üretiyor ve bir ödül sinyali modele o görüntünün ne kadar iyi göründüğünü söylüyor. Hugging Face Blog'a göre, dört ödül teriminden ikisi bizzat sinir ağı modelleri — biri estetik kaliteyi, diğeri suluboya sadakatini değerlendiriyor. Bu, ödül fonksiyonunun bir kural olmadığı anlamına geliyor; ağırlıklara dondurulmuş bir kişinin zevkinin vekilinden ibaret.
Bu üzerinde düşünmeye değer. Bir fotoğrafçı Kodak yerine Ilford film seçtiğinde ya da bir ressam Prusya mavisi için uzandığında, bu tercih bir yazarlık eylemidir. Burada yazarlık dağıtılmış durumda: mühendis ödül modellerini seçti, ödül modelleri başka birinin estetik eğitim verilerini kodluyor ve kod modeli her ikisini de tatmin etmeyi öğreniyor. Ortaya çıkan görüntüler, hiçbiri son fırça darbesinde tam olarak görünmeyen en az üç insan yargısı katmanının parmak izlerini taşıyor.
Belirli bir resimsel stile ulaşmak için Charmloop'ta görüntü üreterek zaman harcayan ve istem diliyle boğuşan yaratıcılar için bu pipeline tamamen farklı bir kaldıraç sunuyor. Bir estetiği kelimelerle tanımlamak yerine, prensipte onu bir ödül modelinde kodlayabilir — ve RL'nin onu üretecek kodu bulmasına izin verebilirsiniz.
Yazının en öğretici kısmı, işe yaramayan şeyler. Üç ayrı deney — eğitim görüntü havuzunu değiştirme, renderer'dan gürültüyü kaldırma ve ikili yargıcı devre dışı bırakma — her biri düz bir ödül eğrisi üretti. Sonunda ibreyi hareket ettiren çalışma, ödül sinyalini değil eğitici yapılandırmasını değiştirdi.
Bu, görsel çıktı için özel RL pipeline'ları oluşturan herkes için yararlı bir negatif sonuç. Ödül şekillendirme, üzerinde yineleme yapılacak açık yer gibi görünüyor; ancak eğitim dinamikleri — öğrenme hızı çizelgeleri, rollout gruplama, KL cezası — gerçek darboğaz olabilir. Bu, cilalı model sürümlerinde nadiren yüzeye çıkan türden zor kazanılmış bir ayrıntı ve bu blog gönderisini çoğundan daha pratik değerli kılıyor.
Difüzyon modelleri tasarım gereği opak: gizli bir vektör, satır satır incelemeye direnen bir süreç aracılığıyla piksellere dönüşüyor. Kod tabanlı render bunu tamamen tersine çeviriyor. Bu deneydeki her resmin yayımlanan rollout veri kümesinde karşılık gelen bir Python kaynak dosyası var — hangi eğrilerin hangi sırayla, hangi opaklıkla çizildiğini tam olarak okuyabilirsiniz.
Süreç belgelendirmesiyle — köken, yeniden üretilebilirlik, bir görüntünün nasıl yapıldığını açıklayabilme yeteneğiyle — ilgilenen sanatçılar için bu denetlenebilirlik, gizli difüzyona kıyasla gerçek bir yapısal avantaj. Aynı zamanda piksel düzeyinde değil algoritmik düzeyde çalışan bir stil transferine giden bir yol açıyor: ağırlıkları değil, kodu paylaşın.
AI sanat modelleri ve stillerinin daha geniş yelpazesini keşfeden yaratıcılar, bu yaklaşımın kendi kategorisinde yer aldığını görecek: bir istemden daha yavaş yineleme, ancak bir LoRA'dan çok daha incelenebilir. Hugging Face ekibi tam TRL ve OpenEnv kurulumunu yayımladı; bu nedenle deneme yapmanın önündeki engel göründüğünden daha düşük — ve Charmloop'taki kılavuzlar, «isteminiz» bir ödül fonksiyonu olduğunda bile geçerliliğini koruyan istem temellerini kapsıyor.