출처
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Elias는 헤드라인 뒤의 연구를 쉬운 언어로 풀어냅니다.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요
AI가 생성한 음식 이미지가 레스토랑 메뉴와 브랜드 캠페인 전반에 퍼지고 있다 — 그런데 지렁이처럼 뭉친 면발부터 퍼티처럼 보이는 아이스크림까지, 항상 똑같은 방식으로 어색하게 보인다.
The Verge의 AI 음식 이미지 심층 분석은 일관된 공포의 목록을 제시한다: 도넛 반죽 질감의 새우, 분해되는 것처럼 보이는 루벤 샌드위치, 하나의 지렁이 덩어리로 합쳐진 면발, 젖은 점토의 표면 장력을 가진 페이스트리. 이것들은 무작위 오류가 아니다. 이는 픽셀 필드를 반복적으로 노이즈 제거하여 이미지를 생성하는 AI 클래스인 디퓨전 모델이 음식의 모습을 학습하는 방식에서 비롯된다.
디퓨전 모델은 웹에서 수집한 방대한 이미지 데이터셋으로 학습한다. 웹의 음식 사진은 이상화된 스톡 이미지 — 과도하게 채도가 높고, 심하게 보정되었으며, 종종 합성된 — 에 크게 편중되어 있다. 모델은 면발이 형태를 유지하는 물리적 원리나 스튜디오 조명 아래에서 아이스크림이 녹는 방식이 아니라, 그 이미지들의 통계적 평균을 학습한다. 그 결과 그럴듯한 색상 팔레트는 맞추지만 재질 논리에서 실패한다 — 모델은 새우가 특정한 반투명성을 가져야 한다거나, 크루아상의 층이 특정한 방식으로 분리되어야 한다는 것을 알지 못한다.
교차 오염 문제가 이를 더욱 악화시킨다. 학습 세트의 음식 이미지에 태그가 느슨하게 붙어 있는 경우가 많기 때문에, 「크리미한」 또는 「실처럼 늘어나는」에 대한 모델의 내부 표현이 카테고리 간에 혼재될 수 있다. 그래서 젖은 종이처럼 섬유질로 보이는 닭고기나, 건축용 폼의 표면 특성을 가진 아이스크림이 나오는 것이다.
크리에이터에게 좋은 소식은, 이러한 실패 유형의 대부분이 모델 개선을 기다리지 않고도 프롬프트 수준에서 해결 가능하다는 점이다.
가장 효과적인 단일 조정은 참조의 구체성이다. 「라멘 한 그릇」을 프롬프트로 입력하는 대신, 지역 스타일(「하카타 돈코츠 라멘」), 육수의 불투명도(「뿌연 돼지 뼈 육수」), 면의 굵기(「가늘고 곧은 면, 탄탄한 식감」)를 명시하라. 모델은 프롬프트가 서로 맞지 않는 예시들의 평균이 되는 일반적인 카테고리가 아니라, 학습 데이터에 실제로 포함된 실제 요리 전통에 고정될 때 더 나은 성능을 발휘한다.
실제 음식 사진에서 차용한 조명 설명어 — 「확산된 오버헤드 소프트박스, 왼쪽에 약간의 그림자」 — 는 모델이 일관된 시각적 참조를 갖지 못하는 「전문적인」 또는 「식욕을 돋우는」 같은 모호한 표현보다 훨씬 효과적이다.
네거티브 프롬프트는 다른 이미지 카테고리보다 여기서 더 중요하다. 「초현실적」, 「광택」, 「녹아내림」, 「과채도」, 「플라스틱」 질감 설명어를 명시적으로 제외하면 가장 흔한 아티팩트 유형이 줄어든다. 생성기가 가중 프롬프팅을 지원한다면, 「완벽한」 음식 이미지 개념(모델이 문제를 일으킨 과보정 스톡 사진과 연관 짓는)의 가중치를 낮추면 결과물을 보다 자연스러운 방향으로 이끌 수 있다.
스타일 참조도 도움이 된다. 특정 요리의 다큐멘터리 사진 미학을 향해 프롬프팅하면 — 일본 음식 잡지 사진은 대부분의 학습 세트에서 잘 표현된 뚜렷한 스타일을 가지고 있다 — 모델이 샘플링할 분포를 더 좁혀준다.
Charmloop의 이미지 생성기에서 음식 관련 캐릭터나 장면을 만드는 크리에이터에게도 동일한 원칙이 적용된다: 추상적인 음식 카테고리가 아닌 구체적이고 이름이 있는 요리와 실제 요리 맥락에 음식 요소를 고정하라. 가이드 섹션에는 구체성과 네거티브 프롬프팅을 더 깊이 다루는 포괄적인 프롬프팅 기법 안내가 있다.
근본적인 모델 문제 — 재질 물리학을 포착하지 못하는 학습 데이터 — 는 더 어려운 과제이며, 개별 크리에이터가 통제할 수 없는 데이터셋 및 아키텍처 수준의 변화가 필요하다. 하지만 프롬프트 수준의 해결책은 오늘 당장 실제로 사용할 수 있으며, 그것이 근본 원인을 이해하는 노력을 가치 있게 만드는 이유다.