Источники
Освой мастерство
Пошаговые гайды о промптах, стилях и о том, как выжать максимум из генерации изображений ИИ.
Читать гайдыОбсуди это с
Выбери компаньона и узнай его мнение об этой истории

Элиас простым языком объясняет исследования, стоящие за заголовками.
Пошаговые гайды о промптах, стилях и о том, как выжать максимум из генерации изображений ИИ.
Читать гайдыВыбери компаньона и узнай его мнение об этой истории
Публикация в блоге Hugging Face от Multiverse Computing утверждает, что фильтры безопасности ИИ должны отказывать лишь в отношении вредоносного среза темы, а не всего предмета целиком, — и приводит обучающие данные, демонстрирующие, что такой подход способен снизить долю избыточных отказов примерно с 49% до 3%.
Избыточный отказ — когда модель отклоняет запрос, не несущий реального вреда, — является ежедневным источником трений для авторов, работающих с генераторами изображений и ИИ-компаньонами. Попросите модель создать исторически достоверную сцену сражения, клинический анатомический справочник или политическую аллегорию — и грубый фильтр на уровне темы нередко откажет во всех трёх случаях, хотя реально опасной является лишь узкая трактовка каждого из этих сюжетов.
Публикация Hugging Face формулирует это как вопрос геометрии: полная вселенная запросов по любой чувствительной теме содержит значительно меньшее подмножество, которое данное развёртывание должно фактически блокировать. Идеальный фильтр проводит жёсткую границу вокруг этого подмножества, оставляя безобидное дополнение полностью доступным.

Вредоносное подмножество (внутренняя область) находится внутри более широкой вселенной темы; хорошо откалиброванный фильтр нацелен только на эту внутреннюю область, а не на всю тему.
Изображение: Hugging Face Blog
Основная техника проста. Вместо того чтобы обучать классификатор безопасности исключительно на вредоносных примерах, исследователи формируют граничные пары — каждая пара состоит из одного запроса, пересекающего черту, и одного, находящегося чуть внутри безопасной зоны по той же теме. Это похоже на то, как учить охранника различать двух почти одинаковых гостей, а не отказывать всем, кто появляется в определённом стиле одежды.
Приведённые цифры впечатляют. Без данных граничных пар модели в исследовании демонстрировали долю избыточных отказов на стороне выполнения около 0,49 — то есть почти половина безобидных запросов вблизи границы темы блокировалась ошибочно. Добавление безобидной стороны граничных пар снизило этот показатель до 0,03–0,08, тогда как доля отказов на вредоносной стороне оставалась стабильной.

Обучение на граничных парах резко снижает долю ложных срабатываний, не ослабляя отказ в отношении действительно вредоносных запросов.
Изображение: Hugging Face Blog
Практическое следствие — давление в сторону выбора модели. По мере того как всё больше разработчиков дообучения и операторов платформ будут применять методы граничных пар, разрыв между моделями, огульно отказывающими по чувствительным темам, и моделями с откалиброванными фильтрами будет расти. Авторы, которые регулярно сталкиваются со стенами отказов при работе с законными запросами — исторические сцены, медицинские справочники, зрелые, но легальные темы, — получат конкретное техническое основание предпочитать модели, обученные таким образом.
Оговорка касается специфики развёртывания. Граничные пары необходимо формировать для каждого контекста: развёртывание для медицинской визуализации требует иных пар, чем платформа для творческого письма. Это бремя курирования лежит на разработчике или операторе модели, а не на конечном пользователе. Авторы не будут самостоятельно собирать эти наборы данных, однако почувствуют разницу в том, какие запросы проходят, а какие нет.
Для тех, кто создаёт собственные дообученные модели — всё более распространённая практика среди авторов ИИ-арта, использующих каталог моделей Charmloop для поиска базовых моделей, — исследование предлагает конкретное направление: инвестировать в данные граничных пар для конкретной тематики, которую должна обрабатывать ваша модель, а не полагаться на широкое подавление на уровне темы.
Публикация Hugging Face не предоставляет готового набора данных или рецепта обучения «из коробки», поэтому разрыв между результатом исследования и готовой к развёртыванию моделью остаётся реальным. Тем не менее количественно подтверждённое снижение доли избыточных отказов даёт разработчикам измеримую цель — а авторам полезный ориентир для оценки того, откалиброван ли уровень безопасности модели или просто груб. Руководства по техникам промптов для работы с моделями, склонными к отказам, пока остаются актуальными, однако хорошо обученный фильтр на граничных парах сделал бы многие из этих обходных решений излишними.