출처
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Iris는 AI 아트와 문화가 만나는 지점을 다룹니다 — 스타일, 작가성, 그리고 의미 있는 이미지들.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요
Hugging Face 엔지니어가 코딩 언어 모델을 수채화 스타일의 그림을 생성하도록 훈련했습니다. 디퓨전 모델을 파인튜닝한 것이 아니라, 강화학습을 사용해 모델이 Python에서 더 나은 draw() 호출을 작성하도록 보상을 제공한 것입니다. 그 결과물은 적당한 GPU를 보유한 누구나 재현할 수 있는 실용적인 파이프라인이며, 「이미지 생성」이 무엇을 의미하는지 자체를 재정의합니다.
핵심 메커니즘은 놀랍도록 단순합니다. 모델이 렌더러를 호출하는 Python 코드를 작성하고, 렌더러가 이미지를 생성하며, 보상 신호가 모델에게 그 이미지가 얼마나 좋은지 알려줍니다. Hugging Face 블로그에 따르면, 네 가지 보상 항목 중 두 가지는 그 자체로 신경망 모델입니다. 하나는 미적 품질을 판단하고, 다른 하나는 수채화 충실도를 판단합니다. 즉, 보상 함수는 규칙이 아니라 특정 인물의 취향을 가중치로 동결한 프록시입니다.
이 점은 곱씹어볼 만합니다. 사진작가가 Kodak 필름 대신 Ilford를 선택하거나, 화가가 프러시안 블루를 집어 드는 것처럼, 그 선호는 저작권의 행위입니다. 여기서 저작권은 분산됩니다. 엔지니어가 보상 모델을 선택하고, 보상 모델은 다른 누군가의 미적 훈련 데이터를 인코딩하며, 코드 모델은 둘 다 만족하도록 학습합니다. 결과 이미지에는 최소 세 겹의 인간 판단의 흔적이 담겨 있으며, 그 어느 것도 최종 붓터치에서 완전히 드러나지 않습니다.
Charmloop에서 이미지를 생성하며 특정 회화적 스타일을 구현하기 위해 프롬프트 언어와 씨름해온 크리에이터들에게, 이 파이프라인은 전혀 다른 레버를 제공합니다. 미학을 말로 묘사하는 대신, 원칙적으로 보상 모델에 인코딩하고 RL이 그것을 생성하는 코드를 찾도록 할 수 있습니다.
이 글에서 가장 교훈적인 부분은 작동하지 않은 것들입니다. 세 가지 별도의 실험(훈련 이미지 풀 교체, 렌더러에서 노이즈 제거, 쌍별 판정자 비활성화) 각각이 평탄한 보상 곡선을 보였습니다. 마침내 지표를 움직인 실행은 보상 신호가 아닌 트레이너 구성을 변경한 것이었습니다.
이는 시각적 출력을 위한 커스텀 RL 파이프라인을 구축하는 누구에게나 유용한 부정적 결과입니다. 보상 설계가 반복할 명백한 지점처럼 보이지만, 훈련 역학(학습률 스케줄, 롤아웃 배칭, KL 페널티)이 실제 병목일 수 있습니다. 이는 완성된 모델 릴리스에서는 좀처럼 드러나지 않는 종류의 힘들게 얻은 세부 사항이며, 이 블로그 포스트를 대부분의 글보다 실용적으로 더 가치 있게 만듭니다.
디퓨전 모델은 설계상 불투명합니다. 잠재 벡터가 픽셀로 변환되는 과정은 줄 단위 검사에 저항합니다. 코드 기반 렌더링은 이를 완전히 뒤집습니다. 이 실험의 모든 그림에는 공개된 롤아웃 데이터셋에 해당하는 Python 소스 파일이 있습니다. 어떤 곡선이 어떤 순서로, 어떤 불투명도로 그려졌는지 정확히 읽을 수 있습니다.
프로세스 문서화(출처, 재현성, 이미지가 어떻게 만들어졌는지 설명하는 능력)에 관심 있는 아티스트들에게, 이 감사 가능성은 잠재 디퓨전에 비해 진정한 구조적 이점입니다. 또한 픽셀 수준이 아닌 알고리즘 수준에서 작동하는 스타일 전이로 가는 길을 열어줍니다. 가중치가 아닌 코드를 공유하면 됩니다.
AI 아트 모델과 스타일의 더 넓은 범위를 탐색하는 크리에이터들은 이 접근 방식이 독자적인 카테고리에 속한다는 것을 알게 될 것입니다. 프롬프트보다 반복이 느리지만, LoRA보다 훨씬 더 검사 가능합니다. Hugging Face 팀은 전체 TRL 및 OpenEnv 설정을 공개했으므로 실험의 장벽은 보이는 것보다 낮습니다. 그리고 Charmloop의 가이드는 「프롬프트」가 보상 함수일 때도 여전히 관련 있는 프롬프팅 기초를 다룹니다.