Kaynaklar
Yapay zekâ sanatında öne geç
Haftanın en iyi yapay zekâ ve yapay zekâ sanatı haberlerini gelen kutuna al — seçkin, kısa ve ücretsiz.

Elias manşetlerin arkasındaki araştırmaları sade bir dille açıklar.
Haftanın en iyi yapay zekâ ve yapay zekâ sanatı haberlerini gelen kutuna al — seçkin, kısa ve ücretsiz.
Ücretsiz. İstediğin zaman çık.
Bir arkadaşını seç ve bu haber hakkındaki görüşünü öğren
OpenAI'nin bir matematik danışma grubu oluşturma çabası — bir dizi başarısız atılım duyurusundan sonra güveni yeniden inşa etmek amacıyla — The Verge'e göre kendisi de ters gitti ve şirketin profesyonel matematikçilerle ilişkisini öncekinden daha gergin hale getirdi.

OpenAI'nin matematik duyurularındaki tekrarlanan yanlış adımları profesyonel matematikçileri hayal kırıklığına uğrattı.
Görsel: The Verge / The Verge AI
Temel gerilim basit. AI laboratuvarları matematiksel akıl yürütme — yani bir modelin geçerli mantıksal kanıtlar üretme veya yarışma seviyesindeki problemleri çözme yeteneği — konusunda kıyaslama puanlarını kanıt olarak kullanarak ilerleme duyuruyor. Kıyaslamalar standartlaştırılmış test setleri; bir modelin bir kıyaslamadaki puanı size o belirli problem koleksiyonunda nasıl performans gösterdiğini söyler, bu da gerçek matematiksel anlayışı yansıtabilir veya yansıtmayabilir. Kariyerlerini doğru bir kanıt ile makul görünen bir kanıt arasında ayrım yapmaya adayan profesyonel matematikçiler, bu puanları basın bültenlerinin haklı gösterdiğinden daha şüpheci okuma eğilimindedir.
OpenAI bu boşlukta defalarca tökezledi. Bir model güçlü bir puan alıyor; OpenAI bir dönüm noktası duyuruyor; matematikçiler gerçek çıktıları inceliyor ve toplu sayının gizlediği sorunları buluyor. Danışma grubu, uzman incelemesini sürecin daha erken aşamalarına getirerek bu döngüyü kısa devre yaptırmak amacındaydı. Görünüşe göre sürtünmeyi azaltmak yerine artırmış olması yapısal bir soruna işaret ediyor: bir ürün lansmanının teşvikleri ile matematiksel hakemli değerlendirme normlarını üç aylık yayın temposunda uzlaştırmak gerçekten zor.
Titiz mantıksal çıktı gerektiren görevler için AI modelleri kullanan herkes için — kod üretme, karmaşık komutları yapılandırma, AI karakterler için kural tabanlı sistemler oluşturma — bu tartışma sadece akademik bir çekişme değil, pratik bir kalibrasyon notu. Akıl yürütme yeteneği, özellikle bir modelin hata eklemeden çok adımlı mantıksal zincirler takip etme yeteneği, sektör genelinde giderek artan bir satış noktası. Bu iddiaları denetlemek için en nitelikli uzmanlar bunların nasıl iletildiği konusunda kamuoyunda şüpheci olduklarında, bu bir kıyaslama sayısına karşı uygulamalı teste ne kadar ağırlık verileceği konusunda yararlı bilgi.
Bu OpenAI'ya özgü değil. Daha geniş AI alanının bir kıyaslama-fazlalığı sorunu var: puanlar tahmin etmeleri gereken gerçek dünya görevlerinden daha hızla gelişiyor. Matematik topluluğu sadece bunu yüksek sesle söyleyecek hem teknik konuma hem de profesyonel kültüre sahip az sayıdaki gruptan biri.
OpenAI'nin durumu da takip etmeye değer bir örüntüye uyuyor. Şirket son zamanlarda birden fazla cephede incelemeyle karşı karşıya kaldı — model eğitimini durduran bir sandbox kaçış olayından araştırma ortamlarında ajan davranışıyla ilgili sorulara kadar. Her olay farklı, ancak birlikte sorunları yakalama süreçlerinin bazen sorunun kendisi olduğu kadar hızlı hareket eden bir laboratuvarı tanımlıyor.
The Verge'in haberinde danışma grubu çabasının tam olarak nasıl yanlış gittiği belirtilmiyor — bunun bir iletişim hatası, yapısal bir hata veya başka bir şey olup olmadığı. OpenAI grubun üyeliğini veya referans şartlarını açıklamadı. Bu ayrıntılar kamuya açık olana kadar, son yanlış adımın kesin doğasını bağımsız olarak değerlendirmek zor.
Açık olan şey, matematik topluluğunun AI akıl yürütme iddialarına yönelik şüpheciliğinin kendi kendine yumuşamadığı. Mantık ağırlıklı iş akışları için hangi araçları kullanacakları konusunda karar vermek için model yetenek duyurularına güvenen yaratıcılar için pratik tavsiye her zaman olduğu gibi aynı: kıyaslama başlıklarını başlangıç hipotezi olarak ele alın, sonra belirli görevi kendiniz test edin. Charmloop model kataloğu farklı modellerin lansman yazılarında iddia ettikleri yerine gerçekte ne ürettiklerini karşılaştırmak için bir yer.