出典
このニュースについて話す相手
コンパニオンを選んで、この話題についての感想を聞いてみましょう

IrisはAIアートと文化が交わる場所を取材 — スタイル、作者性、そして時代を映す作品を追います。
コンパニオンを選んで、この話題についての感想を聞いてみましょう
Hugging Faceのエンジニアが、コーディング言語モデルを使って水彩風の絵画を生成させることに成功した。拡散モデルをファインチューニングするのではなく、強化学習を用いてPythonのdraw()呼び出しをより上手く書くようモデルに報酬を与えるアプローチだ。その結果、手頃なGPUを持つ実践者なら誰でも再現できる動作するパイプラインが完成し、「画像生成」という概念そのものを再定義している。
コアの仕組みは拍子抜けするほどシンプルだ。モデルがレンダラーを呼び出すPythonコードを書き、レンダラーが画像を生成し、リワードシグナルがその画像の出来栄えをモデルに伝える。Hugging Face Blogによると、4つのリワード項のうち2つはそれ自体がニューラルモデルであり、一方は美的品質を、もう一方は水彩画の忠実度を評価する。つまりリワード関数はルールではなく、誰かの審美眼をウェイトに凍結したプロキシなのだ。
これは少し立ち止まって考える価値がある。写真家がKodakではなくIlfordのフィルムを選ぶとき、あるいは画家がプルシアンブルーに手を伸ばすとき、その好みは作家性の行為だ。ここでは作家性が分散している。エンジニアがリワードモデルを選び、リワードモデルが他の誰かの美的訓練データをエンコードし、コードモデルはその両方を満たすように学習する。生成された画像には少なくとも3層の人間の判断の指紋が刻まれているが、最終的なブラシストロークにはそのどれも完全には見えない。
特定の絵画的スタイルを出すためにプロンプト言語と格闘しながらCharmloopで画像を生成する時間を費やしてきたクリエイターにとって、このパイプラインはまったく異なるレバーを提供する。美的感覚を言葉で表現する代わりに、原理的にはリワードモデルにエンコードし、それを生成するコードをRLに見つけさせることができる。
このレポートで最も示唆に富む部分は、うまくいかなかったことだ。3つの独立した実験——訓練画像プールの入れ替え、レンダラーからのノイズ除去、ペアワイズ審判の無効化——はいずれもリワード曲線がフラットになった。最終的にメトリクスを動かしたのは、リワードシグナルではなくトレーナーの設定変更だった。
これは、視覚的出力のためのカスタムRLパイプラインを構築する人にとって有益なネガティブな結果だ。リワード設計は反復する際の明らかな場所だが、学習ダイナミクス——学習率スケジュール、ロールアウトバッチング、KLペナルティ——が実際のボトルネックである可能性がある。これは磨き上げられたモデルリリースではほとんど表面化しない類の苦労して得た詳細であり、このブログ投稿をほとんどのものより実践的に価値あるものにしている。
拡散モデルは設計上不透明だ。潜在ベクトルがピクセルになる過程は、行ごとの検査に抵抗する。コードベースのレンダリングはそれを完全に逆転させる。この実験のすべての絵画には、公開されたロールアウトデータセットに対応するPythonソースファイルがある。どの曲線が、どの順序で、どの不透明度で描かれたかを正確に読み取ることができる。
プロセスのドキュメント化——来歴、再現性、画像がどのように作られたかを説明する能力——を重視するアーティストにとって、この監査可能性は潜在拡散に対する真の構造的優位性だ。また、ピクセルレベルではなくアルゴリズムレベルで機能するスタイル転送への道も開く。ウェイトではなくコードを共有するのだ。
AIアートモデルとスタイルの幅広い範囲を探求するクリエイターは、このアプローチが独自のカテゴリに位置することに気づくだろう。プロンプトよりも反復が遅いが、LoRAよりもはるかに検査しやすい。Hugging FaceチームはTRLとOpenEnvのフルセットアップを公開しており、実験への障壁は見た目より低い。また、「プロンプト」がリワード関数であっても依然として関連するプロンプティングの基礎はCharmloopのガイドでカバーされている。