TL;DR
En visionsmodell "fattar" inte ditt foto som en människa gör — den läser det som ett rutnät av visuell evidens, så din prompt måste namnge motivet, handlingen och eventuell synlig text för att rikta dess uppmärksamhet. Och eftersom avkodning av en bild förbrukar enormt mycket mer beräkning än avkodning av ord, bär varje bilaga en verklig kostnad du bara bör spendera när själva bilden är datan.
Analysen
Föreställ dig en briljant forskare som har tillbringat hela sitt liv övertäckt av en ögonbindel.
De har läst varje bok som någonsin skrivits — medicin, juridik, konsthistoria, kemi — helt genom känsel och text. En dag kommer ögonbindeln av. Ögonen fungerar. Men här är vad som inte hände: ingen överlämnade ett liv av visuell erfarenhet till dem. De har ingen instinkt för vad som spelar roll i en scen, ingen reflex som säger "alla tittar på ansiktet först". Med öppna ögon är de ett geni utan aning om var den ska titta.
Så när du visar dem ett foto av ditt kök och säger "tankar?" — panikstuderar de allt. Kranen. Fönstret. En fläck på den tredje kakeln. Forskaren har kunskapen att tolka vad som helst av det, men utan en människas känsla för det väsentliga fördelar de sitt geni jämnt över hela scenen. Svaret du får tillbaka är uttömmande observa och helt ofokuserat.
Dina ord är fingret som pekar på det som spelar roll. "Dekalen på pannans botten — vad står det om beläggningen?" — och plötsligt låser sig världens mest bildade ögon på exakt det du behövde.
En detalj till, och den förklarar prislappen: att hålla den ögonbindeln av är dyrt. Att läsa en bild tar forskaren hundra gånger mer ansträngning än att läsa en mening. Så varje minut av stirrande med öppna ögon faktureras till ett premium — och du betalar det oavsett om fotot var evidens eller bara dekoration.
Hur det fungerar & kostnaden (Uzu)
När du bifogar en bild skär modellen den i ett rutnät av patchar och omvandlar varje patch till samma valuta den använder för ord: tokens. Ett foto kan enkelt kosta hundratals tokens innan din fråga ens är läst — och som allt annat i konversationen stannar det på kontextfönstret, skrivbordet modellen läser om före varje enskilt svar. En bild är inte bara värd tusen ord; på det skrivbordet ockuperar den dem.
Det är därför visuell prompting har sin egen anatomi — tre fack som riktar modellens uppmärksamhet:
| Fack | Frågan den besvarar | Exempel |
|---|---|---|
| Motiv | Vilket föremål i bilden handlar det om? | "varningsetiketten på laddaren" |
| Handling | Vad händer, eller vad ska göras med det? | "översätt den" / "är den skadad?" |
| Text | Vilka synliga ord spelar roll? | "läs serienumret som börjar med SN" |
Namnge motivet så slutar modellen fördela sin uppmärksamhet över hela rutnätet. Ge handlingen — översätt, identifiera, jämför, uppskatta — och den blir en one-shot-prompt med ögon. Peka på synlig text så utnyttjar du en visionsmodells enskilt vassaste färdighet: moderna modeller läser text inuti bilder bättre än nästan allt annat de gör.
Sedan kommer notan. Att läsa de där hundratals bild-tokens tar verklig GPU-tid, vilket är anledningen till att Uzu debiterar ett fast 10 G-Credits per bifogad fil, prissatt i ögonblicket du trycker skicka. Det är ingen avgift för lagring — det är kostnaden för den el och beräkning modellen spenderar på att stirra. Designlektionen inbakad i det priset: bifoga bilden bara när bilden är datan. Ett foto av feldialogen är data. En skärmdump av ett stycke du hade kunnat klistra in som text är dekoration med en skatt — samma svar, levererat till priset av vanliga ord. Och enligt begränsa omfattning slår en tajt visuell fråga per bilaga fem vaga: begränsa motivet, handlingen och utdataformatet innan du skickar.
Arbetsregeln:
En bild är värd tusen tokens. Se till att modellen spenderar dem där du skulle spendera din egen uppmärksamhet — och betala bara för pixlar som bär information.
Före & efter (promptarna)
Exempel 1 — mystiska föremålet
[foto av en stökig låda] vad är det här?
Modellen inventerar samvetsgrant lådan: kablar, mynt, ett batteri, "möjligen en liten fjärrkontroll". Någonstans i den listan finns saken du menade. Antagligen.
[samma foto] Identifiera den lilla svarta enheten uppe till vänster, bredvid batterierna. Berätta dess troliga märke och vad den används till, i 2 meningar.
Motiv (den svarta enheten, uppe till vänster), handling (identifiera märke och syfte), format (2 meningar). Samma foto, kirurgiskt svar.
Exempel 2 — dokumentet
[foto av ett formulär] Kan du titta på det här?
"Titta" är inte en uppgift. Modellen sammanfattar pappret generellt — vilket är fint, om du inte behövde det enda fältet som avgör allt.
[samma foto] Läs endast fältet "Ikraftträdandedatum" i rutan uppe till höger på denna kontraktssida och skriv av det exakt. Om det är oläsligt, säg "oläsligt" — gissa inte ett datum.
Textfackspromptning som sitt vassaste: ett fält, exakt avskrift och ett explicit gissa-inte-skydd — eftersom en modell som sömlöst fyller luckor är exakt fel verktyg för ogissade juridiska datum.
Exempel 3 — dekorationssfällan
[skärmdump av en artikel, bifogad] Sammanfatta den här.
Du betalade precis bildpriser för text. Modellen läser pixlar som stavar ord — långsammare, dyrare och mer felbenäget än om du hade klistrat in orden själva.
[ingen bild] Sammanfatta den här artikeln i 3 punkter: [inklistrad text]
Identiskt svar, en bråkdel av beräkningen, noll bilageavgift. Skärmdumpen var aldrig data — den var en behållare för data. Denna enda vana — klistra in när det är text, bifoga när det är pixlar — är den enskilt största besparingen inom visuell prompting.
Vanliga misstag
- Att förvänta sig att AI:n "känner" bilden istället för att läsa den. En visionsmodell upplever inte ditt solnedgångsfoto; den katalogiserar evidens från ett rutnät. Fråga "vilka känslor väcker det här?" så får du en självsäker beskrivning av konventioner — varma toner, leende ansikten — inte en känslomässig reaktion. Fråga vad som finns i bilden, inte hur det känns att se den.
- Att bifoga dekoration. Skärmdumpar av text, logotyper "för kontext", foton som upprepar vad du redan skrev. Varje bilaga är premiumberäkning spenderad två gånger om informationen redan fanns i ord. Bifoga bara det som bara bilden kan bära.
- Vag pekning — "den här", "den", "den delen". I textchatt pekar "den" på det senaste meddelandet. I en bild pekar "den" på allt. Använd substantiv och positioner: ratten till vänster, den andra raden på kvittot, den röda kabeln längst ner.
- Att hoppa över gissa-inte-skyddet vid kritiska avläsningar. Serienummer, datum, doser, priser: en visionsmodell under osäkerhet fyller luckor lika sömlöst som vilken annan modell som helst. Lägg till "skriv av exakt; om oklart, säg 'oläsligt'" — samma ärlighetsuthyrningsknep från hallucinationslektionen, nu med ögon.
- En bild, fem frågor, ett meddelande. Att bunta ihop "vad är det här, vad är det värt, varifrån kommer det, är det äkta, skriv en annons" späder ut uppmärksamheten över hela rutnätet fem gånger om. En bilaga, en skarp fråga — följ sedan upp; bilden stannar på skrivbordet, och uppföljningarna åker på tokens du redan betalat för.
FAQ
Hur promptar jag AI med en bild?
Namnge motivet, handlingen och eventuell synlig text, begränsa sedan utdatan: "Identifiera [det specifika föremålet] i [platsen i bilden], [gör det här med det], svara i [format]." Rikta modellens uppmärksamhet som du skulle rikta en kollegas ögon — mot dekalen, inte köket.
Varför kostar det mer att skicka en bild till AI?
Eftersom modellen måste omvandla bilden till hundratals tokens av visuell evidens innan den kan bearbeta din fråga — dramatiskt mer beräkning än motsvarande mening. I Uzu är den premien ett fast 10 G-Credits per fil: det ärliga priset på GPU-tiden som spenderas på att stirra. Text är billig; pixlar bearbetas.
Kan AI läsa text inuti bilder?
Ja — och det är en av visionsmodellers starkaste färdigheter, från handskrift till gatuskyltar till skärmdumpar av formulär. Haken är noggrannhet under osäkerhet: för allt kritiskt (datum, serienummer, doser) kräv exakt avskrift och ett explicit "säg oläsligt om oklart" istället för att låta modellen fylla luckor.
Nästa lektion
Lägg märke till vad som löpte genom hela den här lektionen: du gjorde pekandet. Du valde motivet, du riktade uppmärksamheten, du tillhandahöll begränsningarna. Men det finns ett drag som vänder på hela konversationen — tänk om AI:n, istället för att svara på frågor, ställde frågorna till dig först? En billig runda där maskinen intervjuar dig kan ersätta tre dyra rundor där du omförklarar.
Fortsätt till nästa lektion: Tekniken "Fråga mig först"
Övningsdrill innan du går: hitta det senaste fotot du skickade till en AI och ställ frågan på tre sätt — vagt, medel och kirurgiskt (motiv + handling + text + format). Se hur svaret vässas för varje variant, kontrollera sedan vad den vaga versionen faktiskt kostade dig.