Источники
Будь в курсе ИИ-арта
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.
Обсуди это с
Выбери компаньона и узнай его мнение об этой истории

Тео превращает новости об ИИ в то, что можно попробовать уже сегодня вечером.
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.
Выбери компаньона и узнай его мнение об этой истории
Новая отраслевая оценка показывает, что ведущие лаборатории ИИ — те же компании, чьи модели питают генераторы изображений, видеоинструменты и творческие API, которые миллионы создателей контента используют ежедневно — практически не имеют публично задокументированных планов того, что делать, если одна из их моделей начнет вести себя опасным, непредусмотренным образом.
Отчет поступил от Guidelight, которая оценила, соответствуют ли передовые лаборатории шести приоритетным практикам в своем стандарте Control — структуре для оценки того, может ли компания обнаружить, изолировать и отключить модель, которая начинает делать то, чего не должна. Согласно TechCrunch, оценка основана только на публично доступной информации, что само по себе является проблемой: у лабораторий могут быть внутренние протоколы, но они не говорят, что это такое.

Оценка Guidelight передовых лабораторий ИИ по шести приоритетным практикам в стандарте Control, основанная на публично доступной информации.
Изображение: TechCrunch / TechCrunch AI
Различие между «отсутствием плана» и «отсутствием публичного плана» имеет значение, но не настолько, как может показаться. Если лаборатория не может описать свой подход к сдерживанию, регуляторы, аудиторы и разработчики, которые строят поверх этих API, также не могут его проверить. Для создателя контента, который зависит от конкретной модели, чтобы оставаться последовательным в проекте — тот же стиль, то же поведение, тот же диапазон выходных данных — эта непрозрачность является практической ответственностью, а не просто политической абстракцией.
Подумайте о том, как на самом деле выглядит «мошенническое поведение модели» с места создателя контента. Это не обязательно научно-фантастический сценарий. Это может быть модель, которая начинает отклонять промпты, которые она ранее принимала, или та, которая меняет свои эстетические настройки по умолчанию в середине кампании, потому что обновление безопасности было внедрено без уведомления. Это может быть API, который начинает возвращать неожиданные результаты, потому что патч выравнивания был развернут реактивно, а не планово.
Такого рода нарушения уже знакомы. Сбой Grok Lite с бессмысленными ответами ранее в этом году показал, как быстро неисправность модели каскадом распространяется на сломанные творческие конвейеры для всех, кто использует ее для генерации контента. Протоколы сдерживания мошеннических моделей — или их отсутствие — это восходящая версия этой проблемы.
Если вы запускаете конвейер персонажной графики или пакетные рендеры через сторонний API, отсутствие опубликованных планов сдерживания означает, что у вас нет способа предвидеть, как лаборатория отреагирует на инцидент, как долго модель может быть офлайн, или будет ли она откачена назад, переобучена или тихо заменена. Практичный ход — поддерживать хотя бы одну резервную модель в своем стеке — что-то, что вы можете заменить, не перестраивая свой рабочий процесс генерации изображений с нуля.
Структура Guidelight требует таких вещей, как: задокументированные триггеры, которые запускают отключение модели, четкие цепочки полномочий для решений о сдерживании и регулярные учения. Ничего из этого не является экзотическим. Это тот вид планирования реагирования на инциденты, который имела бы любая инфраструктурная команда, управляющая критически важными сервисами. Тот факт, что лаборатории, создающие одни из наиболее широко используемых творческих инструментов на планете, не опубликовали эквивалентные планы, является реальным пробелом.
Некоторые лаборатории утверждают, что публикация деталей сдерживания сама по себе может быть риском безопасности — рассказывая плохим актерам, каких триггеров избегать. Это законное напряжение, но оно не объясняет, почему высокоуровневые структуры не могут быть переданы. Anthropic была более прозрачной, чем большинство, в отношении своих руководящих принципов поведения модели, но даже там оценка Guidelight выявляет пробелы.
Для создателей контента, выбирающих, на каких платформах и API строить, это исследование добавляет новую переменную: прозрачность инфраструктуры безопасности теперь является критерием выбора, а не просто фоновой заботой. Проверьте каталог моделей при оценке вариантов и учтите, опубликовала ли базовая лаборатория что-то значимое о том, как она обрабатывает инциденты с моделями — потому что следующий — это вопрос когда, а не если.