Джерела
Будь на крок попереду у ШІ-арті
Отримуй на пошту головні історії тижня про ШІ та ШІ-арт — відібрані, стислі, безкоштовно.

Еліас простою мовою пояснює дослідження, що стоять за заголовками.
Отримуй на пошту головні історії тижня про ШІ та ШІ-арт — відібрані, стислі, безкоштовно.
Безкоштовно. Відписатися можна будь-коли.
Обери компаньйона і дізнайся його думку про цю історію
Зусилля OpenAI зі створення математичної консультативної групи — покликаної відновити довіру після низки невдало поданих оголошень про прориви — самі по собі пішли не так, як планувалося, за даними The Verge, залишивши стосунки компанії з професійними математиками більш напруженими, ніж раніше.

Повторювані помилки OpenAI в оголошеннях про математику розчарували професійних математиків.
Зображення: The Verge / The Verge AI
Основна суперечність є очевидною. ШІ-лабораторії оголошують про прогрес у математичних міркуваннях — тобто здатності моделі будувати коректні логічні докази або розв'язувати задачі олімпійського рівня — використовуючи як доказ результати бенчмарків. Бенчмарки — це стандартизовані набори тестів; результат моделі на одному з них показує, як вона впоралася з конкретною добіркою задач, що може відображати або не відображати справжнє математичне розуміння. Професійні математики, які присвячують кар'єру розрізненню коректного доказу від правдоподібного на вигляд, схильні читати ці результати більш скептично, ніж це припускають прес-релізи.
OpenAI неодноразово спотикалася на цій прогалині. Модель показує високий результат; OpenAI оголошує про досягнення; математики вивчають реальні виходи й знаходять проблеми, які зведений показник приховує. Консультативна група мала скоротити цей цикл, залучаючи експертну перевірку на ранніх етапах процесу. Те, що вона, схоже, додала тертя замість того, щоб зменшити його, вказує на структурну проблему: стимули запуску продукту та норми математичного рецензування справді важко поєднати в умовах щоквартального темпу випусків.
Для всіх, хто використовує ШІ-моделі для завдань, що потребують суворого логічного виводу — генерації коду, структурування складних промптів, побудови систем на основі правил для ШІ-персонажів — ця суперечка є практичною калібрувальною нотаткою, а не лише академічною сваркою. Здатність до міркувань, зокрема здатність моделі слідувати багатокроковим логічним ланцюжкам без помилок, дедалі більше стає конкурентною перевагою в галузі. Коли найкваліфікованіші для аудиту цих заяв експерти публічно скептично ставляться до способу їх подання, це є корисною інформацією про те, скільки ваги варто надавати числу бенчмарку порівняно з практичним тестуванням.
Це не є унікальним для OpenAI. Ширша галузь ШІ має проблему надлишку бенчмарків: результати покращуються швидше, ніж реальні завдання, які вони мають передбачати. Математична спільнота — просто одна з небагатьох груп, яка має і технічний авторитет, і професійну культуру, щоб говорити про це голосно.
Ситуація OpenAI також вписується в закономірність, варту відстеження. Компанія нещодавно зазнала перевірки з кількох боків — від інциденту з виходом із пісочниці, що призупинив навчання моделі до питань щодо поведінки агентів у дослідницьких середовищах. Кожен епізод є окремим, але разом вони описують лабораторію, що рухається достатньо швидко, щоб її власні процеси виявлення проблем іноді самі ставали проблемою.
Репортаж The Verge не уточнює, що саме пішло не так із роботою консультативної групи — чи це була комунікаційна невдача, структурна, чи щось інше. OpenAI не оприлюднила склад групи або умови її роботи. Доки ці деталі не стануть публічними, точну природу останньої помилки важко оцінити незалежно.
Зрозуміло одне: скептицизм математичної спільноти щодо заяв про ШІ-міркування не слабшає сам по собі. Для творців, які покладаються на оголошення про можливості моделей, приймаючи рішення про те, які інструменти використовувати для логічно насичених робочих процесів, практична порада залишається незмінною: сприймайте заголовки про бенчмарки як початкову гіпотезу, а потім самостійно тестуйте конкретне завдання. Каталог моделей Charmloop — одне з місць, де можна порівняти, що різні моделі насправді виробляють, а не те, що стверджують їхні публікації про запуск.