Kaynaklar
Yapay zekâ sanatında öne geç
Haftanın en iyi yapay zekâ ve yapay zekâ sanatı haberlerini gelen kutuna al — seçkin, kısa ve ücretsiz.
Ücretsiz. İstediğin zaman çık.
Bunu şununla konuş
Bir arkadaşını seç ve bu haber hakkındaki görüşünü öğren

Sofia yaratıcıların neler üretebileceğini belirleyen parayı, politikaları ve platformları takip eder.
Haftanın en iyi yapay zekâ ve yapay zekâ sanatı haberlerini gelen kutuna al — seçkin, kısa ve ücretsiz.
Ücretsiz. İstediğin zaman çık.
Bir arkadaşını seç ve bu haber hakkındaki görüşünü öğren
Anthropic CEO'su Dario Amodei, sınır AI geliştirmesini yavaşlatmayı kamuoyuna çağırdı ve Claude'u inşa eden laboratuvardan önemli bir yapısal taviz olarak, şirketin güvenlik taahhütlerini doğrulamak için METR gibi bağımsız değerlendiricilere Anthropic'in modellerine doğrudan erişim vermeyi önerdi.

Anthropic'in CEO'su sınır AI geliştirmesi üzerinde yapısal bir kontrol olarak harici denetimleri öneriyor.
Görsel: The Verge / The Verge AI
Amodei'nin bu hafta yayınlanan makalesi, şirketinin «sınırı hızlandırma» olarak adlandırdığı üç adımlı bir plan ortaya koyuyor. Dil kasıtlı: bu AI geliştirmesini durdurmaya değil, hızı güvenlik altyapısının olgunluğuyla senkronize etmeye yönelik bir çağrı. Ayrım önemli çünkü Anthropic aynı anda hem en güvenlik odaklı laboratuvarlardan biri hem de ticari olarak en agresif olanlardan biri — Claude, kurumsal pazarda OpenAI'nin GPT-4o'su ve Google'ın Gemini'sine doğrudan rakip.
METR'ye — tehlikeli otonom yetenekler için AI modellerini değerlendiren kar amacı gütmeyen kuruluş — yönelik spesifik taahhüt, Amodei'nin önerisinin en somut unsuru. METR erişimi, Anthropic'in kendi kırmızı takımları değil, bağımsız araştırmacıların Claude modellerinin dağıtımdan önce veya sırasında belirtilen güvenlik eşiklerini karşılayıp karşılamadığını değerlendireceği anlamına geliyor. Bu, çoğu laboratuvarın şu anda yayınladığı dahili değerlendirmelerden farklı bir standart.
Claude'un API'si üzerinde iş akışları oluşturan veya Claude'u arka planda çalıştıran araçlar kullanan yaratıcılar için bunun gerçek bir aşağı akış etkisi var: METR bir yeteneği yetersiz güvenli olarak işaretlerse, Anthropic muhtemelen onu kısıtlamak veya ertelemek zorunda kalacak. Bu, yeni multimodal özelliklerin daha yavaş kullanıma sunulması, daha sıkı çıktı filtreleri veya aynı taahhüdü vermemiş rakiplere uygulanmayan yetenek sınırları anlamına gelebilir.
«AI'da frenlere basma zamanı geldi.»
— Dario Amodei, Anthropic CEO'su
Tarihsel paralel kayda değer. Stability AI 2023'te kontrolsüz görüntü üretimi ve resmi güvenlik süreçlerinin eksikliği nedeniyle artan baskıyla karşılaştığında, herhangi bir harici hesap verebilirlik mekanizmasının yokluğu şirketin güvenilir bir şekilde kendi kendini düzenlemesini neredeyse imkansız hale getirdi — bunun ardından gelen yönetici ayrılıkları ve itibar hasarına katkıda bulundu. Amodei, aslında, karşılaştırılabilir bir kriz bunu zorlamadan önce Stability'nin hiç sahip olmadığı hesap verebilirliği kurumsallaştırmaya çalışıyor.
Öneri gönüllü. Amodei düzenleyici bir anlaşma veya bağlayıcı bir sektör standardı duyurmuyor — bir makale yayınlıyor ve tercih ettiği bir denetçiyi adlandırıyor. Uygulama mekanizması itibar temelli: Anthropic kendi belirttiği çerçeveye uymakta başarısız olursa, METR veya dış gözlemciler bunu kamuoyuna söyleyebilir. Bu anlamlı bir baskı, ancak yasal bir yükümlülükle aynı şey değil.
Bu, hangi AI görüntü ve video üretim modellerinin kısıtlanmamış kaldığına karşı hangilerinin yetenek geri çekilmeleriyle karşılaştığını takip eden herkes için önemli. Benzer çerçeveleri benimsemeyen laboratuvarlar — ve birkaç büyük laboratuvar bunu yapacağına dair hiçbir işaret vermedi — eşdeğer bir kısıtlamayla karşılaşmıyor. Rekabetçi asimetri, Anthropic'i yeni üretken özellikler konusunda daha temkinli hareket etmeye iterken rakiplerin daha hızlı sevkiyat yapmasına neden olabilir.
Bu yılın başlarında yayınlanan Hugging Face güvenlik alt kümesi araştırması, hedefli güvenlik filtrelerinin tüm konu alanlarını aşırı reddetmeden belirli zararlı çıktıları engelleyecek kadar hassas olabileceğini gösterdi — bu da bu tür denetimli kısıtlama için teknik araçların geliştiğini öne sürüyor. Soru, sektörün ticari teşviklerinin laboratuvarların bunları Amodei'nin önerdiği hızda kullanmasına izin verip vermeyeceği.
Hangi modeller üzerine inşa edeceklerini değerlendiren yaratıcılar için, Charmloop model kataloğu yetenek ve erişim değişikliklerini gerçekleştikleri anda takip ediyor. Amodei'nin önerisinin dişi olup olmadığının bir sonraki somut göstergesi, METR'nin herhangi bir bulgu yayınlayıp yayınlamayacağı — ve sonuç olarak Anthropic'in sürüm programının görünür şekilde değişip değişmeyeceği olacak.