Sources
Maîtrisez l’art IA
Des guides pas à pas sur les prompts, les styles et comment tirer le meilleur de la génération d’images par IA.
Lire les guidesEn discuter avec
Choisissez un compagnon et découvrez son avis sur cette histoire

Elias décrypte la recherche derrière les gros titres en langage clair.
Des guides pas à pas sur les prompts, les styles et comment tirer le meilleur de la génération d’images par IA.
Lire les guidesChoisissez un compagnon et découvrez son avis sur cette histoire
Les images alimentaires générées par IA se répandent sur les menus de restaurants et dans les campagnes de marque — et elles continuent de sembler fausses de manière très spécifique, des nouilles vermiculaires à la glace qui ressemble à du plâtre.
L'analyse approfondie de The Verge sur les images alimentaires IA catalogue un véritable catalogue d'horreurs : des crevettes à la texture de beignet, des sandwichs Reuben qui semblent en décomposition, des nouilles qui fusionnent en une seule masse vermiculaire, et des pâtisseries avec la tension de surface de l'argile humide. Ce ne sont pas des bugs aléatoires. Ils découlent de la façon dont les modèles de diffusion — la classe d'IA qui génère des images en débruitant itérativement un champ de pixels — apprennent à quoi ressemble la nourriture.
Les modèles de diffusion s'entraînent sur d'énormes ensembles de données d'images extraites du web. La photographie culinaire sur le web est fortement orientée vers des images de stock idéalisées : hyper-saturées, très retouchées, et souvent composites. Le modèle apprend une moyenne statistique de ces images, et non la physique de la façon dont une nouille conserve sa forme ou dont la glace fond sous les lumières de studio. Le résultat est des sorties qui atteignent une palette de couleurs plausible mais échouent sur la logique matérielle — le modèle ne sait pas que les crevettes devraient avoir une translucidité spécifique, ou que les couches d'un croissant devraient se séparer d'une manière particulière.
Le problème de contamination croisée aggrave cela. Parce que les images alimentaires dans les ensembles d'entraînement sont souvent étiquetées de manière approximative, la représentation interne du modèle pour « crémeux » ou « filamenteux » peut déborder entre les catégories. C'est pourquoi on obtient du poulet qui a l'aspect fibreux du papier mouillé, ou de la glace qui a les propriétés de surface de la mousse de construction.
La bonne nouvelle pour les créateurs est que la plupart de ces modes d'échec sont corrigeables au niveau du prompt, sans attendre des améliorations du modèle.
L'ajustement le plus efficace est la spécificité de la référence. Au lieu de demander « un bol de ramen », spécifiez le style régional (« ramen tonkotsu de Hakata »), l'opacité du bouillon (« bouillon de os de porc trouble ») et le calibre des nouilles (« nouilles fines et droites, texture ferme »). Les modèles fonctionnent mieux lorsque le prompt s'ancre à une vraie tradition culinaire que les données d'entraînement contiennent réellement, plutôt qu'à une catégorie générique qui se retrouve moyennée sur des exemples incompatibles.
Les descripteurs d'éclairage empruntés à la vraie photographie culinaire — « softbox overhead diffusée, légère ombre à gauche » — surpassent les termes vagues comme « professionnel » ou « appétissant », pour lesquels le modèle n'a pas de référent visuel cohérent.
Les negative prompts comptent ici plus que dans la plupart des autres catégories d'images. Exclure explicitement les descripteurs de texture « surréaliste », « brillant », « fondant », « sursaturé » et « plastique » réduit les types d'artefacts les plus courants. Si votre générateur prend en charge le prompting pondéré, réduire le poids du concept de nourriture « parfaite » (que le modèle associe aux photos de stock surretouchées à l'origine du problème) peut orienter les résultats vers des rendus plus naturalistes.
Les références de style aident également. Orienter le prompt vers l'esthétique de la photographie documentaire d'une cuisine spécifique — la photographie de magazines culinaires japonais a un style distinct et bien représenté dans la plupart des ensembles d'entraînement — donne au modèle une distribution plus étroite à partir de laquelle échantillonner.
Pour les créateurs qui construisent des personnages ou des scènes liés à la nourriture sur le générateur d'images de Charmloop, les mêmes principes s'appliquent : ancrez les éléments alimentaires à des plats spécifiques et nommés et à des contextes culinaires réels plutôt qu'à des catégories alimentaires abstraites. La section guides propose des tutoriels plus complets sur les techniques de prompting couvrant la spécificité et le negative prompting en profondeur.
Le problème sous-jacent du modèle — des données d'entraînement qui ne capturent pas la physique des matériaux — est plus difficile à résoudre, et nécessite des changements au niveau des données et de l'architecture que les créateurs individuels ne peuvent pas contrôler. Mais les solutions de contournement au niveau du prompt sont réelles et utilisables dès aujourd'hui, ce qui rend la compréhension de la cause profonde utile à l'effort.