出典
このニュースについて話す相手
コンパニオンを選んで、この話題についての感想を聞いてみましょう

Eliasは見出しの裏にある研究を、わかりやすい言葉でひもときます。
コンパニオンを選んで、この話題についての感想を聞いてみましょう
AI生成の料理画像がレストランのメニューやブランドキャンペーンに広がっている――そして、ミミズのような麺からパテのように見えるアイスクリームまで、いつも同じ特定のパターンで不自然に見え続けている。
The VergeによるAI料理画像の詳細レポートは、一貫したホラーショーを記録している――ドーナツ生地のエビ、腐敗しているように見えるルーベンサンドイッチ、一本のミミズ状の塊に融合した麺、濡れた粘土のような表面張力を持つペストリー。これらはランダムな不具合ではない。拡散モデル――ピクセルのフィールドを反復的にノイズ除去することで画像を生成するAIのクラス――が料理の見た目をどのように学習するかに起因している。
拡散モデルはウェブからスクレイピングされた膨大な画像データセットで学習する。ウェブ上の料理写真は、超彩度・大幅なレタッチ・合成処理が施された理想化されたストック画像に大きく偏っている。モデルはそれらの画像の統計的平均を学習するのであって、麺がその形を保つ物理法則や、スタジオライトの下でアイスクリームが溶ける様子を学習するわけではない。結果として、もっともらしいカラーパレットは再現できても素材の論理では失敗する出力が生まれる――モデルはエビが特定の半透明性を持つべきことも、クロワッサンの層が特定の方法で剥がれるべきことも知らない。
交差汚染の問題がこれをさらに悪化させる。学習セット内の料理画像はしばしばタグが大雑把なため、「クリーミー」や「繊維状」というモデルの内部表現がカテゴリをまたいで滲み出てしまう。だから、濡れた紙のように繊維状に見える鶏肉や、建築用フォームの表面特性を持つアイスクリームが生まれる。
クリエイターにとって朗報なのは、こうした失敗パターンのほとんどが、モデルの改善を待たずにプロンプトレベルで対処できるということだ。
最も効果的な調整は、参照の具体性だ。「ラーメンの丼」とプロンプトするのではなく、地域スタイル(「博多とんこつラーメン」)、スープの透明度(「濁った豚骨スープ」)、麺の太さ(「細いストレート麺、しっかりした食感」)を指定する。プロンプトが学習データに実際に含まれる本物の料理の伝統に根ざしているほど、互換性のない例を平均化した汎用カテゴリよりもモデルのパフォーマンスは向上する。
実際のフード写真から借用したライティング記述子――「拡散した真上からのソフトボックス、左側にわずかな影」――は、「プロフェッショナル」や「食欲をそそる」といった曖昧な表現よりも優れた結果をもたらす。後者はモデルが一貫した視覚的参照を持たない言葉だ。
ネガティブプロンプトは、他のほとんどの画像カテゴリよりもここで重要になる。「surreal」「glossy」「melting」「oversaturated」「plastic」といったテクスチャ記述子を明示的に除外することで、最も一般的なアーティファクトの種類を削減できる。生成ツールが重み付きプロンプトをサポートしている場合、「完璧な」料理画像というコンセプトのウェイトを下げること(モデルはこれを問題の原因となった過度にレタッチされたストック写真と関連付けている)で、出力をよりナチュラルな結果に引き寄せられる。
スタイル参照も有効だ。特定の料理のドキュメンタリー写真の美学に向けてプロンプトする――日本の料理雑誌の写真は、ほとんどの学習セットで明確かつ豊富に表現されたスタイルを持っている――ことで、モデルがサンプリングする分布を狭めることができる。
Charmloopの画像生成ツールで料理に隣接するキャラクターやシーンを制作するクリエイターにも、同じ原則が当てはまる。抽象的な食品カテゴリではなく、具体的な名前を持つ料理と実際の料理的文脈に食品要素を根ざらせること。ガイドセクションには、具体性とネガティブプロンプトをより詳しくカバーするプロンプト技法のウォークスルーが掲載されている。
根本的なモデルの問題――素材の物理法則を捉えられない学習データ――はより難しい修正であり、個々のクリエイターがコントロールできないデータセットとアーキテクチャレベルの変更を必要とする。しかし、プロンプトレベルの回避策は今日すでに実用的であり、だからこそ根本原因を理解する努力が報われるのだ。