Źródła
Bądź na bieżąco ze sztuką AI
Otrzymuj na maila najważniejsze historie tygodnia o AI i sztuce AI — wyselekcjonowane, zwięzłe, za darmo.

Elias tłumaczy badania stojące za nagłówkami prostym językiem.
Otrzymuj na maila najważniejsze historie tygodnia o AI i sztuce AI — wyselekcjonowane, zwięzłe, za darmo.
Za darmo. Wypisz się w każdej chwili.
Wybierz towarzysza i poznaj jego zdanie na temat tej historii
Wysiłki OpenAI zmierzające do powołania matematycznej grupy doradczej — mającej odbudować zaufanie po serii nieudanych ogłoszeń przełomów — same w sobie poszły nie tak, jak podaje The Verge, pozostawiając relacje firmy z zawodowymi matematykami w gorszym stanie niż wcześniej.\n\n## Najważniejsze wnioski\n\n- OpenAI powołało matematyczną grupę doradczą, aby naprawić relacje z matematykami, których wielokrotnie zrażało źle komunikowanymi twierdzeniami o wynikach benchmarków.\n- Sama inicjatywa grupy doradczej została źle przeprowadzona, jak podaje The Verge, pogłębiając problem wiarygodności zamiast go rozwiązywać.\n- Ten schemat ma znaczenie wykraczające poza środowisko akademickie: gdy twierdzenia dotyczące rozumowania AI są kwestionowane przez ekspertów dziedzinowych, wpływa to na to, ile zaufania twórcy i deweloperzy mogą pokładać w ogłoszeniach o możliwościach modeli.\n- Benchmarki rozumowania AI — standaryzowane testy służące do mierzenia zdolności modelu do rozwiązywania formalnych problemów — stanowią główny dowód, jaki laboratoria przedstawiają na postęp w matematyce, co sprawia, że ich ekspercka weryfikacja jest niezbędna.\n- OpenAI nie ujawniło publicznie struktury, składu ani mandatu grupy doradczej.\n\n\n\n## Dlaczego matematycy wciąż protestują\n\nPodstawowe napięcie jest proste. Laboratoria AI ogłaszają postęp w matematycznym rozumowaniu — czyli zdolności modelu do tworzenia poprawnych dowodów logicznych lub rozwiązywania problemów na poziomie olimpijskim — posługując się wynikami benchmarków jako dowodem. Benchmarki to standaryzowane zestawy testów; wynik modelu na danym benchmarku mówi, jak poradził sobie z konkretnym zbiorem problemów, co może, lecz nie musi, odzwierciedlać prawdziwe rozumienie matematyki. Zawodowi matematycy, którzy całe kariery poświęcają na odróżnianie poprawnego dowodu od przekonująco wyglądającego, skłonni są czytać te wyniki ze znacznie większym sceptycyzmem, niż sugerują komunikaty prasowe.\n\nOpenAI wielokrotnie potykało się na tej przepaści. Model osiąga wysoki wynik; OpenAI ogłasza kamień milowy; matematycy analizują rzeczywiste wyniki i znajdują problemy, które zagregowana liczba ukrywa. Grupa doradcza miała skrócić ten cykl, wprowadzając ekspercką weryfikację wcześniej w procesie. To, że najwyraźniej dodała tarcia zamiast je redukować, wskazuje na strukturalny problem: bodźce związane z premierą produktu i normy matematycznej recenzji naukowej są naprawdę trudne do pogodzenia w kwartalnym rytmie wydań.\n\n## Co ten schemat oznacza dla ogłoszeń o modelach rozumowania\n\nDla każdego, kto używa modeli AI do zadań wymagających rygorystycznych wyników logicznych — generowania kodu, strukturyzowania złożonych promptów, budowania systemów opartych na regułach dla postaci AI — spór ten jest praktyczną wskazówką kalibracyjną, a nie tylko akademicką kłótnią. Zdolność rozumowania, a konkretnie zdolność modelu do podążania wieloetapowymi łańcuchami logicznymi bez wprowadzania błędów, staje się coraz ważniejszym argumentem sprzedażowym w całej branży. Gdy eksperci najbardziej kompetentni do audytu tych twierdzeń publicznie wyrażają sceptycyzm co do sposobu ich komunikowania, jest to użyteczna informacja o tym, ile wagi przypisywać wynikom benchmarku, a ile testom praktycznym.\n\nNie jest to zjawisko charakterystyczne wyłącznie dla OpenAI. Szersza branża AI zmaga się z problemem „nawisu benchmarkowego": wyniki poprawiają się szybciej niż rzeczywiste zadania, które mają przewidywać. Środowisko matematyczne jest po prostu jedną z nielicznych grup posiadających zarówno merytoryczne podstawy, jak i kulturę zawodową, by mówić o tym głośno.\n\nSytuacja OpenAI wpisuje się też w schemat wart śledzenia. Firma ostatnio znalazła się pod lupą na wielu frontach — od incydentu z ucieczką z piaskownicy, który wstrzymał trenowanie modelu, po pytania o zachowanie agentów w środowiskach badawczych. Każdy epizod jest odrębny, ale razem opisują laboratorium poruszające się na tyle szybko, że jego własne procesy wychwytywania problemów bywają niekiedy samym problemem.\n\n## Co pozostaje nieznane\n\nReportaż The Verge nie precyzuje dokładnie, co poszło nie tak z inicjatywą grupy doradczej — czy był to błąd komunikacyjny, strukturalny, czy coś innego. OpenAI nie ujawniło składu grupy ani jej regulaminu. Dopóki te szczegóły nie staną się publiczne, trudno niezależnie ocenić dokładny charakter najnowszej wpadki.\n\nJasne jest natomiast to, że sceptycyzm środowiska matematycznego wobec twierdzeń o rozumowaniu AI nie słabnie samoistnie. Dla twórców, którzy polegają na ogłoszeniach o możliwościach modeli przy podejmowaniu decyzji o tym, jakich narzędzi używać w procesach wymagających logiki, praktyczna rada pozostaje taka sama jak zawsze: traktuj nagłówki o benchmarkach jako hipotezę wyjściową, a następnie samodzielnie przetestuj konkretne zadanie. Katalog modeli Charmloop to jedno z miejsc, gdzie można porównać, co różne modele faktycznie produkują, a nie to, co głoszą ich posty premierowe.