Kaynaklar
İşin ustası ol
Prompt yazımı, stiller ve yapay zekâ görsel üretiminden en iyi şekilde yararlanma üzerine adım adım rehberler.
Rehberleri okuBunu şununla konuş
Bir arkadaşını seç ve bu haber hakkındaki görüşünü öğren

Elias manşetlerin arkasındaki araştırmaları sade bir dille açıklar.
Prompt yazımı, stiller ve yapay zekâ görsel üretiminden en iyi şekilde yararlanma üzerine adım adım rehberler.
Rehberleri okuBir arkadaşını seç ve bu haber hakkındaki görüşünü öğren
Multiverse Computing'den bir Hugging Face blog yazısı, AI güvenlik filtrelerinin tüm konuyu değil, bir konunun zararlı dilimini reddetmesi gerektiğini savunuyor ve bu yaklaşımın aşırı reddetme oranlarını yaklaşık %49'dan %3'e kadar düşürebildiğini gösteren eğitim verisi sunuyor.
Aşırı reddetme — bir modelin gerçek bir zarar oluşturmayan bir istemi reddetmesi — görüntü üreticileri ve AI arkadaşları ile çalışan yaratıcılar için günlük bir sürtünme noktasıdır. Bir modelden tarihsel olarak doğru bir savaş alanı sahnesi, klinik anatomi referansı veya politik bir alegori üretmesini isteyin ve kaba konu düzeyinde bir filtre, bu konuların herhangi birinin yalnızca dar bir çerçevesi gerçekten tehlikeli olmasına rağmen genellikle üçünü de reddedecektir.
Hugging Face yazısı bunu bir geometri sorunu olarak çerçeveliyor: herhangi bir hassas konu üzerindeki istemlerin tam evreni, belirli bir dağıtımın gerçekten engellemesi gereken çok daha küçük bir alt küme içeriyor. İdeal filtre, o alt kümenin etrafına sıkı bir sınır çizerek zararsız tamamlayıcıyı tamamen erişilebilir bırakıyor.

Zararlı alt küme (iç bölge) daha geniş konu evreninin içinde yer alıyor; iyi kalibre edilmiş bir filtre tüm konuyu değil yalnızca o iç bölgeyi hedefliyor.
Görsel: Hugging Face Blog
Temel teknik basittir. Güvenlik sınıflandırıcısını yalnızca zararlı örnekler üzerinde eğitmek yerine, araştırmacılar sınır çiftleri oluşturuyorlar — her çift, çizgiyi aşan bir istem ve aynı konu üzerinde güvenli bölgenin hemen içinde oturan bir istemi içeriyor. Bunu bir kapıcıya belirli bir giyim tarzında gelen herkesi reddetmek yerine neredeyse aynı iki misafiri ayırt etmeyi öğretmek gibi düşünün.
Bildirilen sayılar çarpıcıdır. Sınır-çifti verisi olmadan, çalışmadaki modeller yaklaşık 0,49'luk bir uyum tarafı aşırı reddetme oranı gösterdi — yani konu sınırına yakın zararsız istemlerin neredeyse yarısı yanlış şekilde engellendi. Sınır çiftlerinin zararsız tarafını eklemek bu rakamı 0,03 ile 0,08 arasına düşürürken, zararlı taraf reddetmesi sabit kaldı.

Sınır-çifti eğitimi gerçekten zararlı istemlerin reddedilmesini gevşetmeden yanlış pozitifleri keskin şekilde azaltıyor.
Görsel: Hugging Face Blog
Praktik sonuç model seçim baskısıdır. Daha fazla ince ayarlayıcı ve platform operatörü sınır-çifti yöntemlerini benimserken, hassas konuları genel olarak reddeden modeller ile kalibre edilmiş filtrelere sahip olanlar arasındaki fark genişleyecektir. Meşru istemlerde — tarihsel sahneler, tıbbi referanslar, olgun ama yasal temalar — düzenli olarak reddetme duvarlarına çarpan yaratıcılar, bu şekilde eğitilmiş modelleri tercih etmek için somut teknik bir nedene sahip olacaklar.
Sorun dağıtım özgüllüğüdür. Sınır çiftleri her bağlam için düzenlenmelidir: tıbbi görüntüleme dağıtımı, yaratıcı yazma platformundan farklı çiftlere ihtiyaç duyar. Bu düzenleme yükü son kullanıcıya değil model geliştiricisine veya operatörüne düşer. Yaratıcılar bu veri kümelerini kendileri birleştirmeyecekler, ancak hangi istemlerin geçtiği ve hangilerinin geçmediği konusundaki aşağı akış farkını hissedecekler.
Özel ince ayarlar yapan herkes için — temel modeller bulmak için Charmloop model kataloğunu kullanan AI-sanat yaratıcıları arasında büyüyen bir uygulama — araştırma somut bir yön sunuyor: geniş konu düzeyinde bastırmaya güvenmek yerine, modelinizin ele alması gereken belirli konu için sınır-çifti verisine yatırım yapın.
Hugging Face yazısı hazır bir veri kümesi veya tak-çalıştır eğitim tarifi yayınlamıyor, bu nedenle araştırma sonucu ile dağıtılabilir model arasındaki boşluk gerçek kalıyor. Yine de, aşırı reddetme oranlarındaki ölçülü düşüş geliştiricilere hedefleyecekleri ölçülebilir bir hedef veriyor — ve yaratıcılara bir modelin güvenlik katmanının kalibre mi yoksa sadece kaba mı olduğunu değerlendirmek için yararlı bir kıyaslama noktası sunuyor. Reddetmeye eğilimli modellerle başa çıkmak için istem teknikleri rehberleri bu arada alakalı kalıyor, ancak iyi eğitilmiş bir sınır-çifti filtresi bu geçici çözümlerin çoğunu gereksiz hale getirecektir.