TL;DR
Un modèle de vision ne « comprend » pas votre photo comme une personne — il la lit comme une grille de preuves visuelles, donc votre prompt doit nommer le sujet, l'action et tout texte visible pour pointer son attention. Et comme décoder une image consomme bien plus de calcul que décoder des mots, chaque pièce jointe a un coût réel qu'il ne faut dépenser que quand l'image elle-même est la donnée.
L'Analogie
Imaginez un universitaire brillant qui a passé toute sa vie les yeux bandés.
Il a lu tous les livres jamais écrits — médecine, droit, histoire de l'art, chimie — entièrement à travers le toucher et le texte. Puis, un jour, le bandeau tombe. Les yeux fonctionnent. Mais ceci n'a pas eu lieu : personne ne lui a remis une vie d'expérience visuelle. Il n'a aucun instinct de ce qui compte dans une scène, aucun réflexe qui dit « tout le monde regarde d'abord les visages ». Les yeux ouverts, c'est un génie sans idée de où regarder.
Alors quand vous lui montrez une photo de votre cuisine et dites « impressions ? » — il panique et étudie tout. Le robinet. La fenêtre. Une tache sur le troisième carreau. L'universitaire a la connaissance pour interpréter chacune de ces choses, mais sans le sens humain de ce qui ressort, il répartit son génie uniformément sur toute la scène. La réponse que vous recevez est exhaustivement observatrice et complètement floue.
Vos mots sont le doigt qui pointe ce qui compte. « L'étiquette au fond de la poêle — que dit-elle sur le revêtement ? » — et soudain les yeux les plus éduqués du monde se posent exactement là où il le fallait.
Un détail de plus, qui explique l'étiquette de prix : garder ce bandeau hors des yeux coûte cher. Lire une image demande à l'universitaire cent fois l'effort de lire une phrase. Chaque minute de regard les yeux ouverts est donc facturée au tarif premium — et vous la payez que la photo soit une preuve ou une décoration.
Comment Ça Marche et le Coût (Uzu)
Quand vous joignez une image, le modèle la découpe en une grille de patchs et convertit chaque patch dans la même monnaie que les mots : des tokens. Une photo peut facilement coûter des centaines de tokens avant même que votre question soit lue — et, comme tout le reste dans la conversation, elle reste dans la fenêtre de contexte, le bureau que le modèle relit avant chaque réponse. Une image ne vaut pas mille mots ; sur ce bureau, elle occupe mille mots.
C'est pourquoi le prompting visuel a sa propre anatomie — trois emplacements qui pointent l'attention du modèle :
| Emplacement | La question à laquelle il répond | Exemple |
|---|---|---|
| Sujet | De quelle chose sur l'image s'agit-il ? | « l'étiquette d'avertissement du chargeur » |
| Action | Que se passe-t-il, ou que faut-il en faire ? | « traduis-la » / « est-il endommagé ? » |
| Texte | Quels mots visibles comptent ? | « lis le numéro de série qui commence par SN » |
Nommez le sujet et vous empêchez le modèle de moyenner son attention sur toute la grille. Donnez l'action — traduire, identifier, comparer, estimer — et cela devient un prompt one-shot avec des yeux. Pointez le texte visible et vous exploitez la compétence la plus affûtée d'un modèle de vision : les modèles modernes lisent le texte dans les images mieux que presque tout ce qu'ils font.
Puis arrives l'addition. Lire ces centaines de tokens d'image demande du vrai temps GPU, et c'est pourquoi Uzu facture des frais fixes de 10 G-Credits par pièce jointe, prélevés au moment où vous appuyez sur envoyer. Ce n'est pas des frais de stockage — c'est le coût de l'électricité et du calcul que le modèle dépense à regarder. La leçon de conception intégrée dans ce prix : joignez l'image seulement quand l'image est la donnée. Une photo du dialogue d'erreur est une donnée. Une capture d'écran d'un paragraphe que vous auriez pu coller en texte est une décoration taxée — même réponse, livrée au prix de simples mots. Et selon le limiting scope, une question visuelle resserrée par pièce jointe vaut mieux que cinq vagues : contraignez le sujet, l'action et le format de sortie avant d'envoyer.
La règle de travail :
Une image vaut mille tokens. Assurez-vous que le modèle les dépense là où vous dépenseriez votre propre attention — et ne payez que pour des pixels qui portent de l'information.
Avant / Après (Les Prompts)
Exemple 1 — l'objet mystère
[photo d'un tiroir en désordre] qu'est-ce que c'est ?
Le modèle inventoriera fidèlement le tiroir : câbles, pièces, une pile, « possiblement une petite télécommande ». Quelque part dans cette liste se trouve ce que vous vouliez dire. Probablement.
[même photo] Identifie le petit appareil noir en haut à gauche, à côté des piles. Dis-moi sa marque probable et à quoi il sert, en 2 phrases.
Sujet (l'appareil noir, coin supérieur gauche), action (identifier marque et fonction), format (2 phrases). Même photo, réponse chirurgicale.
Exemple 2 — le document
[photo d'un formulaire] Peux-tu voir ceci ?
« Voir » n'est pas une tâche. Le modèle résume le papier génériquement — ce qui va bien, sauf qu'il vous fallait l'unique case qui décide de tout.
[même photo] Lis uniquement le champ « Date de Validité » dans le cadre en haut à droite de cette page de contrat et transcris-le exactement. S'il est illisible, dis « illisible » — n'invente pas de date.
Du prompting d'emplacement texte à pleine netteté : un champ, transcription exacte et une garde explicite contre les suppositions — parce qu'un modèle qui comble les failles sans couture est exactement le mauvais outil pour des dates juridiques non vérifiées.
Exemple 3 — le piège de la décoration
[capture d'un article, en pièce jointe] Résume ceci.
Vous venez de payer le prix de l'image pour du texte. Le modèle lit des pixels qui épellent des mots — plus lentement, plus cher et plus susceptibility d'erreurs que si vous aviez collé les mots eux-mêmes.
[sans image] Résume cet article en 3 puces : [texte collé]
Réponse identique, une fraction du calcul, zéro frais de pièce jointe. La capture n'a jamais été une donnée — c'était un conteneur de données. Cette seule habitude — collez quand c'est du texte, joignez quand ce sont des pixels — est la plus grosse économie du prompting visuel.
Erreurs Courantes
- Attendre que l'IA « ressente » l'image au lieu de la lire. Un modèle de vision ne fait pas l'expérience de votre photo de coucher de soleil ; il catalogue des preuves d'une grille. Demandez « quelles émotions cela évoque-t-il ? » et vous recevrez une description assurée de conventions — tons chauds, visages souriants — pas une réaction ressentie. Demandez ce qu'il y a dans l'image, pas ce que c'est que de la voir.
- Joindre de la décoration. Captures de texte, logos « pour le contexte », photos qui répètent ce que vous avez déjà écrit. Chaque pièce jointe est du calcul premium dépensé deux fois si l'information était déjà en mots. Ne joignez que ce que seule l'image peut porter.
- Références vagues — « ceci », « ça », « cette partie ». Dans un chat texte, « ça » pointe le dernier message. Sur une image, « ça » pointe tout. Utilisez des noms et des positions : le cadran de gauche, la deuxième ligne du reçu, le câble rouge en bas.
- Omettre la garde contre les suppositions sur les lectures critiques. Numéros de série, dates, dosages, prix : un modèle de vision sous incertitude comble les failles avec la même fluidité que n'importe quel modèle. Ajoutez « transcris exactement ; si ce n'est pas clair, dis "illisible" » — le même tour d'honnêtité louée de la leçon sur les hallucinations, maintenant avec des yeux.
- Une image, cinq questions, un message. Empaqueter « qu'est-ce que c'est, ça vaut combien, d'où ça vient, est-ce authentique, écris une annonce » dilue l'attention sur la grille cinq fois. Une pièce jointe, une question affûtée — puis continuez ; l'image reste sur le bureau, et les questions suivantes voyagent sur des tokens déjà payés.
Questions Fréquentes
Comment faire un prompt d'IA avec une image ?
Nommez le sujet, l'action et tout texte visible, puis contraignez la sortie : « Identifie [la chose précise] dans [l'emplacement sur l'image], [fais ceci avec], réponds en [format]. » Pointez l'attention du modèle comme vous pointeriez les yeux d'un collègue — sur l'étiquette, pas sur la cuisine.
Pourquoi envoyer une image à l'IA coûte-t-il plus cher ?
Parce que le modèle doit convertir l'image en centaines de tokens de preuves visuelles avant de pouvoir traiter votre question — bien plus de calcul que la phrase équivalente. Dans Uzu, cette prime est un tarif fixe de 10 G-Credits par fichier : le prix honnête du temps GPU dépensé à regarder. Le texte est bon marché ; les pixels se traitent.
L'IA peut-elle lire du texte dans les images ?
Oui — et c'est l'une des compétences les plus fortes des modèles de vision, de l'écriture manuscrite aux panneaux de rue en passant par les captures de formulaires. La réserve est la précision sous incertitude : pour tout élément critique (dates, numéros de série, dosages), exigez une transcription exacte et un « dis illisible si ce n'est pas clair » explicite, plutôt que de laisser le modèle combler la faille.
Leçon Suivante
Remarquez ce qui a traversé toute cette leçon : c'est vous qui avez pointé. Vous avez choisi le sujet, visé l'attention, fourni les contraintes. Mais il existe un mouvement qui retourne toute la conversation — et si, au lieu de répondre aux questions, l'IA vous posait les questions à vous d'abord ? Un bon marché de tour de machine qui vous interview peut remplacer trois tours chers de ré-explanations.
Passez à la leçon suivante : La Technique « Demande-Moi d'Abord »
Exercice pratique avant de partir : retrouvez la dernière photo envoyée à une IA et posez la question de trois façons — vague, moyenne et chirurgicale (sujet + action + texte + format). Regardez la réponse s'aiguiser à chaque fois, puis vérifiez combien la version vague vous a réellement coûté.