Источники
Будь в курсе ИИ-арта
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.
Обсуди это с
Выбери компаньона и узнай его мнение об этой истории

София следит за деньгами, политикой и платформами, которые определяют, что могут создавать авторы.
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.
Выбери компаньона и узнай его мнение об этой истории
Генеральный директор Anthropic Дарио Амодеи публично призвал замедлить разработку передовых систем ИИ и предложил предоставить независимым проверяющим организациям, в частности METR, прямой доступ к моделям Anthropic для верификации обязательств компании в области безопасности — существенная структурная уступка со стороны лаборатории, создавшей Claude.

Генеральный директор Anthropic предлагает внешние аудиты как структурный механизм контроля над разработкой передовых систем ИИ.
Изображение: The Verge / The Verge AI
Эссе Амодеи, опубликованное на этой неделе, излагает трёхступенчатый план, который его компания называет «заданием темпа на переднем крае». Формулировка намеренна: это не призыв остановить разработку ИИ, а предложение синхронизировать скорость с зрелостью инфраструктуры безопасности. Различие принципиально, поскольку Anthropic одновременно является одной из наиболее ориентированных на безопасность лабораторий и одной из наиболее коммерчески агрессивных — Claude напрямую конкурирует с GPT-4o от OpenAI и Gemini от Google на корпоративном рынке.
Конкретное обязательство в отношении METR — некоммерческой организации, оценивающей модели ИИ на предмет опасных автономных возможностей, — является наиболее осязаемым элементом предложения Амодеи. Доступ METR означает, что независимые исследователи, а не собственные red team Anthropic, будут оценивать, соответствуют ли модели Claude заявленным порогам безопасности до или в процессе развёртывания. Это иной стандарт по сравнению с внутренними оценками, которые большинство лабораторий публикует сегодня.
Для создателей, выстраивающих рабочие процессы на базе API Claude или использующих инструменты, работающие на Claude «под капотом», это имеет реальные последствия: если METR признает какую-либо возможность недостаточно безопасной, Anthropic, по всей видимости, будет обязана её ограничить или отложить. Это может означать более медленный выход новых мультимодальных функций, более жёсткие фильтры вывода или ограничения возможностей, которые не распространяются на конкурентов, не взявших на себя аналогичных обязательств.
«Пришло время нажать на тормоза в развитии ИИ.»
— Дарио Амодеи, генеральный директор Anthropic
Историческая параллель заслуживает внимания. Когда в 2023 году Stability AI оказалась под нарастающим давлением из-за неконтролируемой генерации изображений и отсутствия формальных процессов обеспечения безопасности, отсутствие какого-либо механизма внешней подотчётности сделало практически невозможным достоверное саморегулирование компании — что способствовало последовавшим уходам руководителей и репутационному ущербу. Амодеи, по сути, пытается институционализировать ту подотчётность, которой у Stability никогда не было, — прежде чем сопоставимый кризис вынудит к этому.
Предложение носит добровольный характер. Амодеи не объявляет о регуляторном соглашении или обязывающем отраслевом стандарте — он публикует эссе и называет предпочтительного аудитора. Механизм принуждения — репутационный: если Anthropic не выполнит собственную заявленную схему, METR или внешние наблюдатели смогут публично об этом заявить. Это значимое давление, но оно не равнозначно юридическому обязательству.
Это важно для всех, кто отслеживает, какие модели генерации ИИ-изображений и видео остаются без ограничений, а какие сталкиваются с откатом возможностей. Лаборатории, не принимающие аналогичных схем, — а несколько крупных игроков не подали никаких признаков готовности к этому, — не несут эквивалентных ограничений. Конкурентная асимметрия может вынудить Anthropic действовать осторожнее при выпуске новых генеративных функций, пока конкуренты будут двигаться быстрее.
Исследование Hugging Face по подмножеству безопасности, опубликованное ранее в этом году, показало, что целевые фильтры безопасности могут быть достаточно точными, чтобы блокировать конкретные вредоносные выходные данные, не отказывая огульно по целым тематическим областям, — что свидетельствует об улучшении технических инструментов для подобного аудируемого сдерживания. Вопрос в том, позволят ли коммерческие стимулы отрасли лабораториям применять их в темпе, который предлагает Амодеи.
Для создателей, оценивающих, на каких моделях строить свои проекты, каталог моделей Charmloop отслеживает изменения возможностей и условий доступа по мере их появления. Следующим конкретным индикатором того, имеет ли предложение Амодеи реальную силу, станет публикация каких-либо выводов METR — и то, изменится ли заметно график выпусков Anthropic в результате.