Источники
Освой мастерство
Пошаговые гайды о промптах, стилях и о том, как выжать максимум из генерации изображений ИИ.
Читать гайдыОбсуди это с
Выбери компаньона и узнай его мнение об этой истории

Ирис пишет о том, где ИИ-искусство встречается с культурой: стиль, авторство и образы, которые имеют значение.
Пошаговые гайды о промптах, стилях и о том, как выжать максимум из генерации изображений ИИ.
Читать гайдыВыбери компаньона и узнай его мнение об этой истории
Инженер Hugging Face обучил языковую модель для генерации кода создавать картины в акварельном стиле — не путём дообучения диффузионной модели, а используя обучение с подкреплением, чтобы поощрять модель за написание более качественных вызовов draw() на Python. Результатом стал рабочий пайплайн, который любой специалист с умеренным GPU может воспроизвести, — и это переосмысляет само понятие «генерации изображений».
Основная механика обезоруживающе проста: модель пишет код на Python, который вызывает рендерер, рендерер создаёт изображение, а сигнал вознаграждения сообщает модели, насколько хорошо это изображение выглядит. По данным Hugging Face Blog, два из четырёх компонентов вознаграждения сами являются нейронными моделями — одна оценивает эстетическое качество, другая — соответствие акварельному стилю. Это означает, что функция вознаграждения — не правило; это прокси чьего-то вкуса, замороженный в весах.
Над этим стоит задуматься. Когда фотограф выбирает плёнку Ilford вместо Kodak или художник тянется за берлинской лазурью, это предпочтение является актом авторства. Здесь авторство распределено: инженер выбрал модели вознаграждения, модели вознаграждения кодируют чьи-то эстетические обучающие данные, а кодовая модель учится удовлетворять обе. Итоговые изображения несут отпечатки как минимум трёх слоёв человеческого суждения, ни один из которых не виден в финальном мазке.
Для авторов, которые тратили время на генерацию изображений в Charmloop и борьбу с языком промптов ради конкретного живописного стиля, этот пайплайн предлагает совершенно иной рычаг. Вместо того чтобы описывать эстетику словами, можно в принципе закодировать её в модели вознаграждения — и позволить RL найти код, который её воспроизводит.
Самая поучительная часть статьи — то, что не сработало. Три отдельных эксперимента — замена пула обучающих изображений, удаление шума из рендерера и отключение попарного судьи — каждый дал плоскую кривую вознаграждения. Запуск, который наконец сдвинул показатель, изменил конфигурацию тренера, а не сигнал вознаграждения.
Это полезный отрицательный результат для всех, кто создаёт собственные RL-пайплайны для визуального вывода. Формирование вознаграждения — очевидное место для итераций, но динамика обучения — расписания скорости обучения, батчинг роллаутов, KL-штраф — может оказаться реальным узким местом. Это именно тот вид выстраданных деталей, который редко всплывает в отполированных релизах моделей, и именно это делает данный пост в блоге практически ценнее большинства.
Диффузионные модели непрозрачны по своей природе: латентный вектор превращается в пиксели через процесс, который не поддаётся построчной проверке. Рендеринг на основе кода полностью переворачивает это. Каждая картина в этом эксперименте имеет соответствующий исходный файл Python в опубликованном датасете роллаутов — можно прочитать, какие именно кривые были нарисованы, в каком порядке и с какой прозрачностью.
Для художников, озабоченных документированием процесса — происхождением, воспроизводимостью, возможностью объяснить, как было создано изображение, — эта аудируемость является подлинным структурным преимуществом перед латентной диффузией. Она также открывает путь к переносу стиля, работающему на алгоритмическом уровне, а не на уровне пикселей: делитесь кодом, а не весами.
Авторы, исследующие широкий спектр моделей и стилей ИИ-арта, обнаружат, что этот подход занимает собственную нишу: итерации медленнее, чем с промптом, но гораздо более прозрачны, чем с LoRA. Команда Hugging Face опубликовала полную настройку TRL и OpenEnv, так что порог для экспериментов ниже, чем кажется, — а руководства на Charmloop охватывают основы промптинга, которые остаются актуальными даже когда ваш «промпт» — это функция вознаграждения.