TL;DR

Een vision-model "snapt" je foto niet zoals een mens dat doet — het leest hem als een raster van visueel bewijs, dus je prompt moet het onderwerp, de handeling en eventuele zichtbare tekst benoemen om zijn aandacht te richten. En omdat het decoderen van een afbeelding enorm veel meer rekenwerk verbrandt dan het decoderen van woorden, draagt elke bijlage een reële kostenpost mee die je alleen moet uitgeven wanneer de afbeelding zélf de data is.

De analogie

Stel je een briljante geleerde voor die zijn hele leven geblinddoekt heeft doorgebracht.

Hij heeft elk boek gelezen dat ooit is geschreven — geneeskunde, recht, kunstgeschiedenis, scheikunde — volledig via tast en tekst. Op een dag gaat de blinddoek af. De ogen werken. Maar dit is er niet gebeurd: niemand gaf hem een leven vol visuele ervaring. Hij heeft geen instinct voor wat belangrijk is in een scène, geen reflex die zegt "iedereen kijkt eerst naar het gezicht." Met open ogen is hij een genie zonder idee waar hij moet kijken.

Dus wanneer je hem een foto van je keuken laat zien en zegt "gedachten?" — bestudeert hij in panische alles. De kraan. Het raam. Een vlek op de derde tegel. De geleerde heeft de kennis om elk onderdeel ervan te interpreteren, maar zonder het menselijke gevoel voor het wezenlijke verdeelt hij zijn genialiteit gelijkmatig over de hele scène. Het antwoord dat je terugkrijgt is uitputtend observerend en volledig gefocust-on-niets.

Jouw woorden zijn de vinger die wijst naar wat ertoe doet. "De sticker onderaan de pan — wat staat daar over de coating?" — en plotseling klampen 's werelds meest geschoolde ogen zich vast aan precies datgene wat je nodig had.

Nog één detail, en het verklaart het prijskaartje: die blinddoek afhouden is duur. Het lezen van een afbeelding kost de geleerde honderd keer de inspanning van het lezen van een zin. Elke minuut staren met open ogen wordt dus tegen een premie gefactureerd — en je betaalt die, of de foto nu bewijs was of gewoon decoratie.

Hoe het werkt & de kosten (Uzu)

Wanneer je een afbeelding bijvoegt, snijdt het model die in een raster van patches en converteert elke patch naar dezelfde valuta die het voor woorden gebruikt: tokens. Een foto kan makkelijk honderden tokens kosten voordat je vraag zelfs is gelezen — en zoals alles in het gesprek blijft die liggen op het contextvenster, het bureau dat het model vóór elk afzonderlijk antwoord herleest. Een afbeelding is niet alleen duizend woorden waard; op dat bureau bezet ze die.

Daarom heeft visueel prompten zijn eigen anatomie — drie vakken die de aandacht van het model richten:

VakDe vraag die het beantwoordtVoorbeeld
OnderwerpWelk ding in de afbeelding gaat het over?"het waarschuwingslabel op de oplader"
HandelingWat gebeurt er, of wat moet ermee gedaan worden?"vertaal het" / "is hij beschadigd?"
TekstWelke zichtbare woorden zijn belangrijk?"lees het serienummer dat begint met SN"

Benoem het onderwerp en je stopt het model ermee zijn aandacht over het hele raster te middelen. Geef de handeling — vertaal, identificeer, vergelijk, schat — en het wordt een one-shot prompt met ogen. Wijs zichtbare tekst aan en je benut de scherpste enkele vaardigheid van een vision-model: moderne modellen lezen tekst binnen afbeeldingen beter dan vrijwel alles wat ze verder doen.

Dan de rekening. Het lezen van die honderden afbeeldingstokens kost echte GPU-tijd, en daarom rekent Uzu een vast bedrag van 10 G-Credits per bijgevoegd bestand, geprijsd op het moment dat je op verzenden drukt. Het is geen vergoeding voor opslag — het is de kosten van de elektriciteit en rekenkracht die het model uitgeeft aan staren. De ontwerples die in die prijs is gebakken: voeg de afbeelding alleen toe wanneer de afbeelding de data is. Een foto van het foutmeldingsvenster is data. Een screenshot van een alinea die je als tekst had kunnen plakken is decoratie met belasting — hetzelfde antwoord, geleverd voor de prijs van gewone woorden. En volgens scope beperken verslaat één strakke visuele vraag per bijlage vage vijf: beperk het onderwerp, de handeling en het outputformaat voordat je verstuurt.

De werkregel:

Een afbeelding is duizend tokens waard. Zorg dat het model ze uitgeeft waar jij je eigen aandacht zou uitgeven — en betaal alleen voor pixels die informatie dragen.

Voor & na (de prompts)

Voorbeeld 1 — het mysterieuze voorwerp

[foto van een rommelige la] wat is dit?

Het model inventariseert plichtsgetrouw de la: kabels, munten, een batterij, "mogelijk een kleine afstandsbediening". Ergens in die lijst staat het ding dat je bedoelde. Waarschijnlijk.

[zelfde foto] Identificeer het kleine zwarte apparaartje linksboven, naast de batterijen. Vertel me het waarschijnlijke merk en waar het voor dient, in 2 zinnen.

Onderwerp (het zwarte apparaat, linksboven), handeling (identificeer merk en doel), formaat (2 zinnen). Zelfde foto, chirurgisch antwoord.

Voorbeeld 2 — het document

[foto van een formulier] Kun je hier even naar kijken?

"Kijken" is geen taak. Het model vat het papier generiek samen — prima, tenzij je juist dat ene veld nodig had dat alles beslist.

[zelfde foto] Lees alleen het veld "Ingangsdatum" in het vak rechtsboven van deze contractpagina en schrijf het exact over. Als het onleesbaar is, zeg dan "onleesbaar" — gis geen datum.

Tekstvak-prompting op zijn scherpst: één veld, exacte overname, en een expliciete niet-gissen-bewaking — want een model dat hiaten naadloos opvult is precies het verkeerde gereedschap voor niet-gegistte juridische datums.

Voorbeeld 3 — de decoratieval

[screenshot van een artikel, bijgevoegd] Vat dit samen.

Je betaalde zojuist afbeeldingsprijzen voor tekst. Het model leest pixels die woorden spellen — langzamer, duurder en foutgevoeliger dan wanneer je de woorden zelf had geplakt.

[geen afbeelding] Vat dit artikel samen in 3 bullets: [geplakte tekst]

Identiek antwoord, een fractie van de rekenkracht, nul bijlagekosten. De screenshot was nooit data — het was een-container voor data. Deze ene gewoonte — plakken als het tekst is, bijvoegen als het pixels zijn — is de grootste enkele besparing in visueel prompten.

Veelvoorkomende valkuilen

  1. Verwachten dat de AI de afbeelding "voelt" in plaats van leest. Een vision-model beleeft je zonsondergangsfoto niet; het catalogiseert bewijs uit een raster. Vraag "welke emoties roept dit op?" en je krijgt een zelfverzekerde beschrijving van conventies — warme tonen, lachende gezichten — geen gevoelde reactie. Vraag wat er in de afbeelding staat, niet hoe het is om hem te zien.
  2. Decoratie bijvoegen. Screenshots van tekst, logo's "ter context", foto's die herhalen wat je al had getypt. Elke bijlage is premiumberkening, twee keer uitgegeven als de informatie al in woorden stond. Voeg alleen toe wat alleen de afbeelding kan dragen.
  3. Vage aanwijzingen — "dit", "hij", "dat gedeelte". In tekstchat wijst "hij" naar het laatste bericht. In een afbeelding wijst "hij" naar alles. Gebruik zelfstandige naamwoorden en posities: de draaiknop links, de tweede regel van de bon, het rode snoer onderaan.
  4. De niet-gissen-bewaking overslaan bij kritieke leeswerk. Serienummers, datums, doseringen, prijzen: een vision-model onder onzekerheid vult hiaten net zo naadloos als elk ander model. Voeg toe "schrijf exact over; als onduidelijk, zeg 'onleesbaar'" — dezelfde eerlijkheid-huren-truc uit de hallucinatieles, nu met ogen.
  5. Eén afbeelding, vijf vragen, één bericht. "Wat is dit, wat is het waard, waar komt het vandaan, is het echt, schrijf een advertentie" bundelen verdunt de aandacht over het hele raster, vijf keer over. Eén bijlage, één scherpe vraag — stel daarna je vervolgvragen; de afbeelding blijft op het bureau liggen, en de vervolgvragen rijden mee op tokens die je al betaald hebt.

FAQ

Hoe prompt ik AI met een afbeelding?

Benoem het onderwerp, de handeling en eventuele zichtbare tekst, en beperk dan de output: "Identificeer [het specifieke ding] op [de locatie in de afbeelding], [doe hiermee dit], antwoord in [formaat]." Richt de aandacht van het model zoals je de ogen van een collega zou richten — naar de sticker, niet naar de keuken.

Waarom kost het meer om een afbeelding naar AI te sturen?

Omdat het model de afbeelding eerst moet omzetten in honderden tokens visueel bewijs voordat het je vraag kan verwerken — dramatisch meer rekenwerk dan de equivalente zin. In Uzu is die premie een vast bedrag van 10 G-Credits per bestand: de eerlijke prijs van de GPU-tijd die aan het staren wordt besteed. Tekst is goedkoop; pixels worden verwerkt.

Kan AI tekst binnen afbeeldingen lezen?

Ja — en het is een van de sterkste vaardigheden van vision-modellen, van handschrift tot straatborden tot screenshots van formulieren. De adder is nauwkeurigheid onder onzekerheid: voor alles wat kritisch is (datums, serienummers, doseringen) eis je exacte overname en een expliciet "zeg onleesbaar als onduidelijk" in plaats van het model hiaten te laten vullen.

Volgende les

Merk op wat er door deze hele les liep: jij deed het wijzen. Jij koos het onderwerp, jij richtte de aandacht, jij leverde de beperkingen. Maar er is een zet die het hele gesprek omdraait — wat als de AI, in plaats van vragen te beantwoorden, jóú eerst de vragen stelde? Eén goedkope ronde waarin de machine jou interviewt kan drie dure rondes van jou her-uitleggen vervangen.

Ga door naar de volgende les: De "Vraag mij eerst"-techniek

Oefendrill voor je gaat: zoek de laatste foto die je aan een AI stuurde en stel de vraag op drie manieren — vaag, gemiddeld en chirurgisch (onderwerp + handeling + tekst + formaat). Kijk hoe het antwoord bij elke versie aanscherpt, en controleer dan wat de vage versie je feitelijk heeft gekost.