Kaynaklar
İş başında gör
Böyle hikâyelerin ardındaki modelleri ve stilleri keşfet — ücretsiz hesap, anında galeri.
Kataloğu keşfet
Böyle hikâyelerin ardındaki modelleri ve stilleri keşfet — ücretsiz hesap, anında galeri.
Kataloğu keşfetBir web scraper, DMCA'ya dayalı mahkeme sürecinde Google ve Reddit'i yendi; bir hukuk uzmanı platformların stratejisini «tuhaf» olarak nitelendirdi — ve bu sonucun, yapay zeka eğitim veri kümelerinin nasıl oluşturulduğu ile kamuya açık web'e erişimi kimin kontrol ettiği üzerinde gerçek etkileri var.
Dijital Milenyum Telif Hakkı Yasası, telif hakkı ihlallerini — yani korunan eserlerin izinsiz kopyalanması ve dağıtılmasını — ele almak amacıyla tasarlandı. Bunu, kamuya açık web sayfalarını okuyan bir scraper'ı durdurmak için kullanmak, Ars Technica tarafından alıntılanan uzmana göre oldukça zorlama bir yorumdur. DMCA'nın teknik koruma önlemlerine ilişkin hükümleri, DRM gibi mekanizmaları hedef alır; robots.txt dosyalarını ya da API hız sınırlarını değil. Google ve Reddit, web taramayı bir DMCA ihlali olarak çerçevelemeye çalışırken esasen sunucularının korumalı bir teknolojik kilit oluşturduğunu savunuyordu — mahkemelerin tarihsel olarak şüpheyle yaklaştığı bir teori.
Scraper'ın temel argümanı doğrudandır: açık web, tek bir platforma ait değildir. Kamuya açık sayfaları dizine eklemek; arama motorlarının, akademik araştırmacıların ve yapay zeka eğitim süreçlerinin hepsinin yaptığı şeydir. Mahkemenin bu çerçeveyi benimsemesi, web taramanın sonuçsuz olduğu anlamına gelmiyor — sözleşme hukuku ve Bilgisayar Dolandırıcılığı ve Kötüye Kullanımı Yasası platformlar için hâlâ geçerli araçlar — ancak bu karar, scraping karşıtı cephanelikten en saldırgan silahlardan birini kaldırıyor.
Yapay zeka model geliştiricileri açısından karar, kısmi bir yeşil ışık niteliği taşıyor. Büyük dil modelleri ve Stable Diffusion ile türevleri gibi görüntü üretim sistemleri, web'den toplanan veri kümeleri — Common Crawl, LAION ve diğerleri — üzerine inşa edildi. Bu sürece yönelik hukuki itirazlar çoğunlukla telif hakkı sahiplerinden (yazarlar, sanatçılar, fotoğrafçılar) geldi; bu kişiler, kendi eserlerinin rızaları alınmadan kullanıldığını öne sürdü. Google/Reddit davası farklıydı: platformların web'in kendisine erişimi kontrol etmek için DMCA'yı kullanıp kullanamayacağıyla ilgiliydi.
Bu yolun daraltılmasıyla birlikte asıl mücadele alanı, kullanım koşullarının uygulanmasına ve mahkemelerin henüz tam olarak çözmediği telif hakkı sorularına kayıyor. Anthropic'in yazar uzlaşması finansal bir emsal oluşturdu — kitap başına yaklaşık 3.000 dolar — ancak telif hakkıyla korunan metinler üzerinde eğitim yapmanın ihlal sayılıp sayılmayacağını kesin olarak ortaya koymadı. Görüntü üretim modeli geliştiricileri de görsel içerik için aynı yanıtsız soruyla yüzleşiyor.
Yapay zeka görüntü araçlarını kullanan yaratıcılar için bu kararın daha sessiz ama gerçek bir etkisi var: eğitim verilerinin genişliği ve güncelliği, modellerin neleri oluşturabileceğini, niş tarzları ne ölçüde işleyebildiğini ve yeni görsel trendleri ne kadar hızlı özümsediğini belirliyor. Scraper'ların kamuya açık web'e erişimini destekleyen bir hukuki ortam, daha zengin ve güncel eğitim kümelerini besliyor — bu da zamanla model kalitesine ve stilistik çeşitliliğe yansıyor. Mevcut modellerle neler yapılabileceğini keşfeden yaratıcılar, eğitim verisi çeşitliliğinin farklı üretim stillerinde pratikte nasıl sonuçlar doğurduğunu görmek için Charmloop kataloğuna göz atabilir.
Ars Technica'ya göre Google, mahkeme yenilgisine rağmen mücadeleden vazgeçmiyor — bu durum, Google'ın bizzat dünyanın en büyük web scraper'larından biri olduğu düşünüldüğünde dikkat çekicidir. Şirketin kendi Googlebot'u, kamuya açık web'in tamamını sürekli olarak dizine ekliyor. Eleştirmenler, Google'ın bir yandan kendi tarama hakkını savunurken öte yandan — özellikle bu scraper'lar yapay zeka rakiplerini beslediğinde — başkalarını engellemaya çalışmasındaki çelişkiye dikkat çekti.
Reddit'in motivasyonu daha açık: platform, Google ile bir veri lisanslama anlaşması imzaladı ve üçüncü taraf API ile scraping erişimini kısıtlayarak bu gelir akışını agresif biçimde korumaya çalışıyor. DMCA aracılığıyla bu kısıtlamaları uygulama kapasitesini zayıflatan bir karar, doğrudan ticari bir gerileme anlamına geliyor.
Bu dava son söz olmayacak. Platformlar hukuki stratejilerini uyarlayacak ve Kongre, web platformlarına otomatik erişim üzerinde daha açık bir kontrol tanıyan mevzuat çıkarabilir. Ancak şimdilik kamuya açık web — en azından hukuki açıdan — kapalı bir bahçeden çok bir ortak alana daha yakın olmaya devam ediyor.