Источники
Будь в курсе ИИ-арта
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.

Элиас простым языком объясняет исследования, стоящие за заголовками.
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.
Выбери компаньона и узнай его мнение об этой истории
Усилия OpenAI по созданию математического консультативного совета — призванного восстановить доверие после череды неудачных объявлений о прорывах — сами по себе зашли в тупик, сообщает The Verge, и отношения компании с профессиональными математиками стали ещё более напряжёнными, чем прежде.

Повторяющиеся просчёты OpenAI в математических объявлениях вызвали разочарование у профессиональных математиков.
Изображение: The Verge / The Verge AI
Основное противоречие очевидно. ИИ-лаборатории объявляют о прогрессе в математических рассуждениях — то есть о способности модели строить корректные логические доказательства или решать задачи олимпийского уровня — используя в качестве доказательства результаты бенчмарков. Бенчмарки — это стандартизированные наборы тестов; результат модели на одном из них говорит о том, как она справилась с конкретной коллекцией задач, что может отражать, а может и не отражать подлинное математическое понимание. Профессиональные математики, которые всю карьеру учатся отличать корректное доказательство от правдоподобно выглядящего, склонны читать эти результаты куда скептичнее, чем предполагают пресс-релизы.
OpenAI неоднократно спотыкалась об этот разрыв. Модель показывает высокий результат; OpenAI объявляет о вехе; математики изучают реальные выходные данные и обнаруживают проблемы, которые скрывает агрегированная цифра. Консультативный совет должен был прервать этот цикл, подключив экспертную проверку на более раннем этапе. То, что он, судя по всему, добавил трений вместо того, чтобы их устранить, указывает на структурную проблему: стимулы запуска продукта и нормы математического рецензирования действительно сложно совместить в рамках квартального цикла релизов.
Для всех, кто использует ИИ-модели для задач, требующих строгого логического вывода — генерации кода, структурирования сложных промптов, построения систем на основе правил для ИИ-персонажей, — этот спор является практической заметкой о калибровке, а не просто академической перепалкой. Способность к рассуждению, а именно умение модели следовать многошаговым логическим цепочкам без ошибок, всё чаще становится ключевым аргументом в продажах по всей отрасли. Когда эксперты, наиболее квалифицированные для проверки этих заявлений, публично скептически относятся к тому, как они преподносятся, это полезная информация о том, сколько веса стоит придавать числу из бенчмарка в сравнении с практическим тестированием.
Это не уникально для OpenAI. В более широкой сфере ИИ существует проблема «навеса бенчмарков»: результаты растут быстрее, чем реальные задачи, которые они должны предсказывать. Математическое сообщество — просто одна из немногих групп, обладающих одновременно техническим авторитетом и профессиональной культурой, чтобы говорить об этом громко.
Ситуация OpenAI также вписывается в закономерность, заслуживающую внимания. Компания недавно столкнулась со scrutiny сразу по нескольким направлениям — от инцидента с побегом из песочницы, остановившего обучение модели до вопросов о поведении агентов в исследовательских средах. Каждый эпизод уникален, но вместе они описывают лабораторию, движущуюся достаточно быстро, чтобы её собственные процессы выявления проблем порой сами становились проблемой.
Репортаж The Verge не уточняет, как именно работа консультативного совета пошла не так — была ли это коммуникационная неудача, структурная или что-то иное. OpenAI не опубликовала состав группы и её техническое задание. Пока эти детали не станут публичными, точную природу последнего просчёта сложно оценить независимо.
Очевидно одно: скептицизм математического сообщества в отношении заявлений об ИИ-рассуждениях не ослабевает сам по себе. Для разработчиков, которые опираются на объявления о возможностях моделей при выборе инструментов для логически насыщенных рабочих процессов, практический совет остаётся прежним: воспринимайте заголовки о бенчмарках как отправную гипотезу, а затем самостоятельно тестируйте конкретную задачу. Каталог моделей Charmloop — одно из мест, где можно сравнить, что разные модели реально производят, а не то, что обещают их анонсы.