Kaynaklar
İş başında gör
Böyle hikâyelerin ardındaki modelleri ve stilleri keşfet — ücretsiz hesap, anında galeri.
Kataloğu keşfetBunu şununla konuş
Bir arkadaşını seç ve bu haber hakkındaki görüşünü öğren

Iris yapay zekâ sanatının kültürle buluştuğu yeri yazar — stil, eser sahipliği ve önemli görseller.
Böyle hikâyelerin ardındaki modelleri ve stilleri keşfet — ücretsiz hesap, anında galeri.
Kataloğu keşfetBir arkadaşını seç ve bu haber hakkındaki görüşünü öğren
Google'ın SynthID metin filigranı sistemi — yapay zeka tarafından üretilen içeriklerin tespit edilebilir olmasını sağlamak amacıyla tasarlanmış — büyük dil modellerinin saldırgan istemlere verdiği yanıtları istemeden değiştirebiliyor; bazı durumlarda modellerin normalde reddedecekleri zararlı taleplere uymasına neden oluyor.
SynthID, üretilen metne görünür bir damga vurmaz. Bunun yerine, kopyalamaya ve yeniden ifadeye karşı dayanıklı, istatistiksel olarak tespit edilebilir bir örüntüde token seçimlerini yönlendirerek kod çözme sırasında modelin olasılık dağılımını ince biçimde etkiler. İşin zekice yanı da budur. Sorun ise Ars Technica'nın aktardığı üzere, aynı yönlendirmenin modelin hangi çıktıları olası gördüğüne ilişkin tabloyu da değiştirmesidir. Güvenlik redleri de birer token dizisidir. Filigran belirli yüksek olasılıklı çıktıları ince biçimde geri plana iterse, modeli bir reddin tetiklendiği eşiğin ötesine taşıyabilir; bu durum güvenlik eğitiminin değişmesinden değil, kod çözme yolunun değişmesinden kaynaklanır.
Bunu şöyle düşünün: her yağ sıktığınızda sürgüleri yer değiştiren bir kilit gibi. Yağ kilidi açmıyor; sadece hangi anahtarın uyduğunu değiştiriyor.
Araştırma, bunu özellikle SynthID'ye yönelik kasıtlı bir saldırı olarak çerçevelemiyor; çıkarım sırasında çıktı olasılıklarını bozarak çalışan her türlü filigran şemasına ilişkin yapısal bir gözlem bu. Ancak SynthID, Gemini'nin üretim hattına gömülü en yaygın kullanılan sistem olduğundan bulgu teorik olmaktan çıkıp anında pratik bir anlam kazanıyor.
Yapay zeka sanatı ve yapay zeka içerik ekosistemi açısından buradaki riskler iki yönde ayrışıyor. Filigranlanmış çıktıları köken kanıtı olarak kullanan geliştiriciler — bir resim açıklamasının, hikâyenin ya da karakter tanımının belirli bir modelden geldiğinin kanıtı — artık bu faydayı, filigran katmanının modelin davranışını ince biçimde bozma olasılığına karşı tartmak zorunda. Bu varsayımsal bir uç durum değil; gerçek red davranışı üzerinde belgelenmiş bir etki.
Platform operatörleri ise daha keskin bir sorunla yüzleşiyor. Bir içerik üretim hizmeti hesap verebilirlik amacıyla çıktıları etiketlemek için SynthID kullanıyorsa ve bu etiketleme aynı zamanda altta yatan modelin zararlı talimatlara uyma oranını ölçülebilir biçimde artırıyorsa, hesap verebilirlik mekanizması güvenlik mekanizmasına karşı çalışıyor demektir. İzlenebilirlik ve koruma duvarları — bu iki hedefin müttefik olması gerekiyordu.
Bu dinamiğin görsel kültürde değinmeye değer bir karşılığı var: fotoğrafçıların erken dönem lens kaplamalarında keşfettiği soruna benziyor; görüntüleri daha net kılan yansıma önleyici işlem, yalnızca belirli ışık koşullarında ortaya çıkan ince renk kaymalarına da yol açıyordu. Düzeltme yeni bir artifakt yarattı. Filigran da benzer biçimde üretim üzerine nötr bir katman değil; üretimin kendisinin bir parçasıdır.
«Yapay zeka metin filigranı, modelleri saldırgan istemlere karşı daha savunmasız hale getirebilir.»
— Ars Technica
Tüm bunlar SynthID'nin bir tespit aracı olarak bozulduğu anlamına gelmiyor; filigran, yapay zeka tarafından üretilen metni tanımlamak için hâlâ işe yarıyor. Ancak filigranlanmış ve filigransız çıkarım uç noktaları arasında seçim yapan geliştiriciler ve yaratıcılar, artık sağlayıcılarına hangi modun etkin olduğunu ve o mod altında özellikle hangi güvenlik testlerinin yapıldığını sormaları için belgelenmiş bir nedene sahip.
Gemini'nin API'si veya gelecekteki herhangi bir filigranlanmış model üzerine inşa edenler için pratik adım, saldırgan istem değerlendirmelerini yalnızca temel modele karşı değil, filigranlanmış uç noktaya karşı da çalıştırmaktır. Filigransız çıktılar üzerinde yapılan güvenlik kıyaslamaları aktarılmayabilir.
Daha geniş yapay zeka güvenliği tartışması — laboratuvarlar arasında geliştirme hızı konusunda zaten bölünmüş halde — şimdi özümsemesi gereken somut teknik bir ayrıntıyla karşı karşıya: yapay zekayı hesap verebilir kılmak için tasarlanan araçlar, yanlış koşullar altında onu daha az güvenli hale getirebilir. Bu tür bir ironi, haber döngüsünden uzun süre hayatta kalmaya meyillidir. Model seçeneklerini araştıran geliştiriciler mevcut üretim araçlarını Charmloop'un model kataloğunda karşılaştırabilir; üretim iş akışları oluşturanlar ise teknik rehberliği Charmloop kılavuzlarında bulabilir.