TL;DR

Un modello visivo non "capisce" la tua foto come una persona — la legge come una griglia di evidenza visiva, quindi il tuo prompt deve nominare il soggetto, l'azione e qualsiasi testo visibile per mirare la sua attenzione. E dato che decodificare un'immagine brucia molto più calcolo che decodificare parole, ogni allegato porta un costo reale che dovresti spendere solo quando l'immagine stessa è il dato.

L'analogia

Immagina uno studioso brillante che ha passato l'intera vita bendato.

Ha letto ogni libro mai scritto — medicina, diritto, storia dell'arte, chimica — interamente attraverso il tatto e il testo. Poi un giorno, la benda viene via. Gli occhi funzionano. Ma ecco cosa non è successo: nessuno gli ha consegnato una vita di esperienza visiva. Non ha istinto per ciò che conta in una scena, nessun riflesso che dica "tutti guardano prima il volto". Ad occhi aperti, è un genio senza idea di dove guardare.

Quindi quando gli mostri una foto della tua cucina e dici "impressioni?" — lui la studia in panico tutta. Il rubinetto. La finestra. Una macchia sulla terza piastrella. Lo studioso ha la conoscenza per interpretare qualsiasi cosa, ma senza il senso umano del rilevante, distribuisce il genio uniformemente sull'intera scena. La risposta che ricevi è esaustivamente osservante e completamente sfocata.

Le tue parole sono il dito che indica ciò che conta. "L'adesivo sul fondo della padella — cosa dice sul rivestimento?" — e improvvisamente gli occhi più istruiti del mondo si bloccano esattamente sulla cosa che ti serviva.

Un dettaglio in più, che spiega il prezzo: tenere quella benda sollevata è costoso. Leggere un'immagine richiede allo studioso cento volte lo sforzo di leggere una frase. Quindi ogni minuto di fissare a occhi aperti viene fatturato a premio — e lo paghi che la foto fosse evidenza o solo decorazione.

Come funziona e il costo (Uzu)

Quando alleghi un'immagine, il modello la affetta in una griglia di patch e converte ogni patch nella stessa valuta che usa per le parole: token. Una foto può facilmente costare centinaia di token prima ancora che la tua domanda venga letta — e come tutto il resto nella conversazione, resta sulla finestra di contesto, il bancone che il modello rilegge prima di ogni singola risposta. Un'immagine non vale solo mille parole; su quel bancone, le occupa.

Ecco perché il prompting visivo ha una sua anatomia — tre slot che mirano l'attenzione del modello:

SlotLa domanda a cui rispondeEsempio
SoggettoDi quale cosa nell'immagine si tratta?"l'etichetta di avvertimento sul caricatore"
AzioneCosa sta succedendo, o cosa se ne dovrebbe fare?"traducila" / "è danneggiato?"
TestoQuali parole visibili contano?"leggi il numero di serie che inizia per SN"

Nominare il soggetto e fermi il modello dal mediare la sua attenzione sull'intera griglia. Dai l'azione — tradurre, identificare, confrontare, stimare — e diventa un prompt one-shot con gli occhi. Punti al testo visibile e sfrutti la singola abilità più affilata di un modello visivo: i modelli moderni leggono il testo dentro le immagini meglio di quasi qualsiasi altra cosa facciano.

Poi c'è il conto. Leggere quelle centinaia di token-immagine richiede vero tempo GPU, ecco perché Uzu addebita un forfait di 10 G-Credits per file allegato, prezzato nel momento in cui premi invio. Non è una tariffa di archiviazione — è il costo dell'elettricità e del calcolo che il modello spende fissando. La lezione di design cotta in quel prezzo: allega l'immagine solo quando l'immagine è il dato. Una foto della finestra di errore è un dato. Uno screenshot di un paragrafo che avresti potuto incollare come testo è decorazione con tassa — la stessa risposta, consegnata al prezzo di parole semplici. E per limitare lo scope, una domanda visiva stretta per allegato batte cinque vaghe: vincola il soggetto, l'azione e il formato di output prima di inviare.

La regola operativa:

Un'immagine vale mille token. Assicurati che il modello li spenda dove spenderesti la tua stessa attenzione — e paga solo pixel che trasportano informazione.

Prima e dopo (i prompt)

Esempio 1 — l'oggetto misterioso

[foto di un cassetto ingombro] cos'è questo?

Il modello inventaria diligentemente il cassetto: cavi, monete, una batteria, "forse un piccolo telecomando". Da qualche parte in quella lista c'è la cosa che intendevi. Probabilmente.

[stessa foto] Identifica il piccolo dispositivo nero in alto a sinistra, accanto alle batterie. Dimmi la probabile marca e a cosa serve, in 2 frasi.

Soggetto (il dispositivo nero, alto a sinistra), azione (identificare marca e scopo), formato (2 frasi). Stessa foto, risposta chirurgica.

Esempio 2 — il documento

[foto di un modulo] Puoi guardarlo?

"Guardare" non è un compito. Il modello riassume il foglio genericamente — il che va bene, a meno che non ti servisse l'unico campo che decide tutto.

[stessa foto] Leggi solo il campo "Data di efficacia" nel riquadro in alto a destra di questa pagina di contratto e trascrivilo esattamente. Se è illeggibile, di' "illeggibile" — non inventare una data.

Prompting dello slot-testo al suo massimo: un campo, trascrizione esatta e un'esplicita guardia contro l'inventare — perché un modello che riempie i vuoti senza cuciture è esattamente lo strumento sbagliato per date legali non verificate.

Esempio 3 — la trappola della decorazione

[screenshot di un articolo, allegato] Riassumilo.

Hai appena pagato prezzi da immagine per del testo. Il modello legge pixel che scrivono parole — più lento, più costoso e più soggetto a errori che se avessi incollato le parole stesse.

[senza immagine] Riassumi questo articolo in 3 bullet: [testo incollato]

Risposta identica, una frazione del calcolo, zero costi di allegato. Lo screenshot non è mai stato un dato — era un contenitore per dati. Questa singola abitudine — incolla quando è testo, allega quando sono pixel — è il risparmio più grande del prompting visivo.

Errori comuni

  1. Aspettarsi che l'IA "senta" l'immagine invece di leggerla. Un modello visivo non vive la tua foto del tramonto; cataloga evidenza da una griglia. Chiedi "quali emozioni evoca?" e otterrai una descrizione sicura di convenzioni — toni caldi, volti sorridenti — non una reazione sentita. Chiedi cosa c'è nell'immagine, non com'è vederla.
  2. Allegare decorazione. Screenshot di testo, loghi "per contesto", foto che ripetono ciò che hai già digitato. Ogni allegato è calcolo premium speso due volte se l'informazione era già in parole. Allega solo ciò che solo l'immagine può trasportare.
  3. Deissi vaga — "questo", "lo", "quella parte". Nella chat testuale, "lo" punta all'ultimo messaggio. In un'immagine, "lo" punta a tutto. Usa nomi e posizioni: il quadrante a sinistra, la seconda riga dello scontrino, il filo rosso in basso.
  4. Saltare la guardia anti-invenzione sulle letture critiche. Numeri di serie, date, dosi, prezzi: un modello visivo sotto incertezza riempie i vuoti con la stessa scioltezza di qualsiasi altro modello. Aggiungi "trascrivi esattamente; se non è chiaro, di' 'illeggibile'" — lo stesso trucco di affitto dell'onestà della lezione sulle allucinazioni, ora con gli occhi.
  5. Un'immagine, cinque domande, un messaggio. Impacchettare "cos'è, quanto vale, da dove viene, è autentico, scrivi un annuncio" diluisce l'attenzione sull'intera griglia cinque volte. Un allegato, una domanda affilata — poi fai follow-up; l'immagine resta sul bancone, e i follow-up viaggiano su token che hai già pagato.

FAQ

Come faccio un prompt all'IA con un'immagine?

Nomina il soggetto, l'azione e qualsiasi testo visibile, poi vincola l'output: "Identifica [la cosa specifica] in [la posizione nell'immagine], [fai questo con essa], rispondi in [formato]." Punta l'attenzione del modello come punteresti gli occhi di un collega — sull'adesivo, non sulla cucina.

Perché inviare un'immagine all'IA costa di più?

Perché il modello deve convertire l'immagine in centinaia di token di evidenza visiva prima di poter processare la tua domanda — drasticamente più calcolo della frase equivalente. In Uzu, quel premio è un forfait di 10 G-Credits per file: il prezzo onesto del tempo GPU speso a fissare. Il testo è economico; i pixel vengono processati.

L'IA può leggere il testo dentro le immagini?

Sì — ed è una delle abilità più forti dei modelli visivi, dalla scrittura a mano ai cartelli stradali agli screenshot di moduli. Il problema è l'accuratezza sotto incertezza: per qualsiasi cosa critica (date, numeri di serie, dosi), esigi trascrizione esatta e un esplicito "di' illeggibile se non è chiaro" invece di lasciare che il modello riempia i vuoti.

Prossima lezione

Nota cosa ha attraversato questa intera lezione: tu hai puntato. Hai scelto il soggetto, hai mirato l'attenzione, hai fornito i vincoli. Ma c'è una mossa che capovolge l'intera conversazione — e se, invece di rispondere a domande, l'IA facesse le domande a te per prima? Un giro economico della macchina che ti intervista può sostituire tre giri costosi di te che rispieghi.

Continua alla prossima lezione: La tecnica "Chiedimi prima"

Esercizio pratico prima di andare: trova l'ultima foto che hai inviato a un'IA e rifai la domanda in tre modi — vago, medio e chirurgico (soggetto + azione + testo + formato). Guarda la risposta affilarsi a ogni modo, poi controlla quanto ti è costata davvero la versione vaga.