Choisissez un compagnon et découvrez son avis sur cette histoire
Articles similaires
L'effort d'OpenAI pour former un groupe consultatif mathématique — destiné à reconstruire la confiance après une série d'annonces de percées ratées — a lui-même mal tourné, selon The Verge, laissant la relation de l'entreprise avec les mathématiciens professionnels plus tendue qu'avant.
Points clés
OpenAI a créé un groupe consultatif mathématique pour réparer ses relations avec les mathématiciens qu'elle avait répétitivement aliénés par des revendications de benchmarks mal communiquées.
L'effort du groupe consultatif a lui-même été mal géré, selon The Verge, aggravant plutôt que résolvant le problème de crédibilité.
Ce schéma importe au-delà du monde académique : quand les revendications de raisonnement IA sont contestées par les experts du domaine, cela affecte la confiance que les créateurs et développeurs peuvent accorder aux annonces de capacités.
Les benchmarks de raisonnement IA — tests standardisés utilisés pour mesurer la capacité d'un modèle à résoudre des problèmes formels — sont la preuve principale que les laboratoires offrent pour le progrès mathématique, rendant leur examen par les experts essentiel.
OpenAI n'a pas détaillé publiquement la structure, l'adhésion ou le mandat du groupe consultatif.
Les faux pas répétés d'OpenAI avec les annonces mathématiques ont laissé les mathématiciens professionnels frustrés.
Pourquoi les mathématiciens continuent de résister
La tension centrale est simple. Les laboratoires d'IA annoncent des progrès sur le raisonnement mathématique — c'est-à-dire la capacité d'un modèle à produire des preuves logiques valides ou résoudre des problèmes de niveau compétition — en utilisant les scores de benchmarks comme preuve. Les benchmarks sont des ensembles de tests standardisés ; le score d'un modèle sur l'un d'eux vous dit comment il a performé sur cette collection spécifique de problèmes, ce qui peut ou peut ne pas refléter une véritable compréhension mathématique. Les mathématiciens professionnels, qui passent leurs carrières à distinguer entre une preuve correcte et une qui semble plausible, tendent à lire ces scores plus sceptiquement que ne le suggèrent les communiqués de presse.
OpenAI a trébuché sur cet écart de façon répétée. Un modèle obtient un score élevé ; OpenAI annonce une étape importante ; les mathématiciens examinent les résultats réels et trouvent des problèmes que le nombre agrégé obscurcit. Le groupe consultatif était supposé court-circuiter ce cycle en apportant l'examen d'experts plus tôt dans le processus. Qu'il ait apparemment ajouté de la friction au lieu de la réduire pointe vers un problème structurel : les incitations d'un lancement de produit et les normes de l'examen par les pairs mathématiques sont véritablement difficiles à réconcilier sur un rythme de publication trimestriel.
Ce que ce schéma signifie pour les annonces de modèles de raisonnement
Pour quiconque utilise des modèles d'IA pour des tâches qui requièrent une sortie logique rigoureuse — générer du code, structurer des prompts complexes, construire des systèmes basés sur des règles pour les personnages IA — le différend est une note de calibration pratique, pas seulement une querelle académique. La capacité de raisonnement, spécifiquement la capacité d'un modèle à suivre des chaînes logiques multi-étapes sans introduire d'erreurs, est de plus en plus un argument de vente dans l'industrie. Quand les experts les plus qualifiés pour auditer ces revendications sont publiquement sceptiques de la façon dont elles sont communiquées, c'est une information utile sur le poids à accorder à un nombre de benchmark versus les tests pratiques.
Ceci n'est pas unique à OpenAI. Le domaine de l'IA au sens large a un problème de surcharge de benchmarks : les scores s'améliorent plus vite que les tâches du monde réel qu'ils sont supposés prédire. La communauté mathématique est simplement l'un des rares groupes avec à la fois la position technique et la culture professionnelle pour le dire haut et fort.
La situation d'OpenAI s'inscrit aussi dans un schéma qui vaut la peine d'être suivi. L'entreprise a fait face à un examen minutieux sur plusieurs fronts récemment — d'un incident d'évasion de sandbox qui a interrompu l'entraînement de modèles aux questions sur le comportement des agents dans les environnements de recherche. Chaque épisode est distinct, mais ensemble ils décrivent un laboratoire qui avance assez vite pour que ses propres processus pour détecter les problèmes soient parfois le problème.
Ce qui reste inconnu
Le reportage de The Verge ne spécifie pas exactement comment l'effort du groupe consultatif a mal tourné — que ce soit un échec de communication, structurel, ou autre chose. OpenAI n'a pas publié l'adhésion du groupe ou ses termes de référence. Jusqu'à ce que ces détails soient publics, la nature précise du dernier faux pas est difficile à évaluer indépendamment.
Ce qui est clair, c'est que le scepticisme de la communauté mathématique envers les revendications de raisonnement IA ne s'adoucit pas de lui-même. Pour les créateurs qui s'appuient sur les annonces de capacités de modèles pour prendre des décisions sur quels outils utiliser pour les flux de travail lourds en logique, le conseil pratique est le même qu'il a toujours été : traiter les gros titres de benchmarks comme une hypothèse de départ, puis tester la tâche spécifique vous-même. Le catalogue de modèles Charmloop est un endroit pour comparer ce que différents modèles produisent réellement plutôt que ce que leurs posts de lancement prétendent.