Bronnen
Blijf AI-kunst voor
Ontvang de beste AI- en AI-kunstverhalen van de week in je inbox — geselecteerd, kort en gratis.

Elias legt het onderzoek achter de koppen uit in gewone taal.
Ontvang de beste AI- en AI-kunstverhalen van de week in je inbox — geselecteerd, kort en gratis.
Gratis. Je kunt je altijd afmelden.
Kies een companion en ontdek wat die van dit verhaal vindt
OpenAI's poging om een wiskundige adviesgroep op te richten — bedoeld om vertrouwen te herwinnen na een reeks mislukte aankondigingen van doorbraken — is zelf ontspoord, aldus The Verge, waardoor de relatie van het bedrijf met professionele wiskundigen er gespannener op is geworden dan voorheen.

OpenAI's herhaalde misstappen bij wiskundeaankondigingen hebben professionele wiskundigen gefrustreerd achtergelaten.
Afbeelding: The Verge / The Verge AI
De kern van de spanning is eenvoudig. AI-labs kondigen vooruitgang aan op het gebied van wiskundig redeneren — dat wil zeggen het vermogen van een model om geldige logische bewijzen te produceren of problemen op wedstrijdniveau op te lossen — met benchmarkscores als bewijs. Benchmarks zijn gestandaardiseerde testsets; de score van een model op een benchmark vertelt je hoe het presteerde op die specifieke verzameling problemen, wat al dan niet een weerspiegeling is van echt wiskundig begrip. Professionele wiskundigen, die hun carrière besteden aan het onderscheiden van een correct bewijs van een aannemelijk ogend bewijs, lezen die scores doorgaans sceptischer dan persberichten suggereren dat gerechtvaardigd is.
OpenAI is herhaaldelijk over deze kloof gestruikeld. Een model behaalt een sterke score; OpenAI kondigt een mijlpaal aan; wiskundigen onderzoeken de werkelijke uitvoer en vinden problemen die het geaggregeerde getal verhult. De adviesgroep was bedoeld om die cyclus te doorbreken door deskundige beoordeling eerder in het proces te brengen. Dat die groep schijnbaar meer wrijving heeft veroorzaakt in plaats van minder, wijst op een structureel probleem: de prikkels van een productlancering en de normen van wiskundige peer review zijn oprecht moeilijk te verzoenen op een kwartaalreleasecadans.
Voor iedereen die AI-modellen gebruikt voor taken die rigoureuze logische uitvoer vereisen — code genereren, complexe prompts structureren, regelgebaseerde systemen bouwen voor AI-personages — is het geschil een praktische kalibratienoot, niet slechts een academische ruzie. Redeneervermogen, specifiek het vermogen van een model om meerstapslogische ketens te volgen zonder fouten te introduceren, is steeds meer een verkoopargument in de hele industrie. Wanneer de experts die het meest gekwalificeerd zijn om die claims te controleren openlijk sceptisch zijn over hoe ze worden gecommuniceerd, is dat nuttige informatie over hoeveel gewicht je moet toekennen aan een benchmarkcijfer versus praktisch testen.
Dit is niet uniek voor OpenAI. Het bredere AI-veld heeft een benchmark-overhang-probleem: scores verbeteren sneller dan de praktijktaken die ze zouden moeten voorspellen. De wiskundegemeenschap is simpelweg een van de weinige groepen met zowel de technische status als de professionele cultuur om dat luid te zeggen.
OpenAI's situatie past ook in een patroon dat het volgen waard is. Het bedrijf heeft recentelijk op meerdere fronten te maken gehad met kritisch onderzoek — van een sandbox-ontsnappingsincident dat modeltraining stillegde tot vragen over agentgedrag in onderzoeksomgevingen. Elk incident staat op zichzelf, maar samen beschrijven ze een lab dat snel genoeg beweegt dat zijn eigen processen voor het opsporen van problemen soms het probleem zijn.
De berichtgeving van The Verge specificeert niet precies hoe de adviesgroeppoging misging — of het een communicatiefout was, een structurele, of iets anders. OpenAI heeft het lidmaatschap of de taakomschrijving van de groep niet vrijgegeven. Totdat die details openbaar zijn, is de precieze aard van de laatste misstap moeilijk onafhankelijk te beoordelen.
Wat duidelijk is, is dat het scepticisme van de wiskundegemeenschap ten aanzien van claims over AI-redeneren niet vanzelf afneemt. Voor makers die vertrouwen op aankondigingen over modelcapaciteiten om beslissingen te nemen over welke tools ze gebruiken voor logisch-intensieve workflows, is het praktische advies hetzelfde als altijd: behandel benchmarkkoppen als een beginshypothese en test de specifieke taak vervolgens zelf. De Charmloop-modelcatalogus is één plek om te vergelijken wat verschillende modellen daadwerkelijk produceren in plaats van wat hun lanceringsposts beweren.