TL;DR

視覺模型不會像人一樣「理解」你的照片 —— 它把照片讀成一格一格的視覺證據網格,所以你的提示必須點名主體、動作、以及任何可見文字來引導它的注意力。而且因為解碼圖片燒掉的運算遠多於解碼文字,每個附件都帶著真實成本 —— 只有當圖片本身就是資料時才值得花。

類比

想像一位終生蒙著眼罩的天才學者。

他讀過所有寫過的書 —— 醫學、法律、藝術史、化學 —— 全靠觸覺與文字。然後有一天,眼罩摘下來了。眼睛能用。但有件事沒發生:沒有人給他一輩子的視覺經驗。他對場景中什麼重要沒有直覺,沒有「大家都先看臉」的反射。張開眼的他,是一位不知道該往哪裡看的天才。

所以當你給他看一張你廚房的照片並說*「有什麼想法?」—— 他恐慌式地研究每一樣東西*。水龍頭。窗戶。第三塊磁磚上的污漬。學者有能力詮釋其中任何一項,但沒有一般人對「顯著性」的感知,他把天才平均分配到整個場景。你得到的答案觀察詳盡卻完全失焦。

你的話語就是指向重點的手指。「鍋子底部的貼紙 —— 上面關於塗層寫了什麼?」—— 突然間,世界上受過最高教育的眼睛鎖定在你需要的東西上。

還有一個細節,它解釋了價格標籤:讓眼罩一直摘著很貴。 學者讀一張圖片花的力氣是讀一個句子的百倍。所以每一分鐘的張眼凝視都以高價計費 —— 無論照片是證據還是純裝飾,你都付錢。

運作原理與成本(Uzu)

當你附加圖片,模型把它切成一格格的 patch,並把每個 patch 轉換成它處理文字的同一貨幣:token。一張照片在你的問題被讀取之前,就可能輕易花掉數百個 token —— 而且就像對話中的一切,它留在脈絡視窗上,那張模型在每次回覆前重讀的桌子。一張圖不只是一圖勝千言;在那張桌上,它佔用千言。

這就是為什麼視覺提示有自己的解剖結構 —— 三個引導模型注意力的欄位:

欄位它回答的問題範例
主體圖片裡的這件事是關於什麼東西「充電器上的警告標籤」
動作正在發生什麼,或該對它做什麼?「翻譯它」/「它損壞了嗎?」
文字哪些可見的文字重要?「讀出以 SN 開頭的序號」

點名主體,模型就不再把注意力平均分配到整個網格。給出動作 —— 翻譯、辨識、比較、估計 —— 它就成了有眼睛的 one-shot 提示。指向可見文字,你就利用了視覺模型最尖銳的單一技能:現代模型讀圖片文字的能力,幾乎比它們做的任何其他事都好。

然後是帳單。讀取那數百個圖片 token 需要真實的 GPU 時間,這就是為什麼 Uzu 對每個附加檔案收取固定 10 G-Credits,在你按下送出的瞬間計價。這不是儲存費 —— 這是模型凝視所花費的電力與運算成本。這個價格內建的設計課題是:只有當圖片本身就是資料時才附加圖片。 錯誤對話框的照片是資料。一段你可以貼成文字的文章截圖,是帶稅的裝飾 —— 同樣的答案,用純文字的價格送達。而根據限制範圍,一次附件一個緊湊的視覺問題勝過五個模糊的問題:送出前先約束主體、動作和輸出格式。

工作規則:

一張圖值一千個 token。 確保模型把它們花在你會花自己注意力的地方 —— 而且只為承載資訊的像素付費。

改寫前後(提示)

範例 1 —— 神秘物體

[雜亂抽屜的照片] 這是什麼?

模型盡責地清點抽屜:線材、硬幣、電池、「可能是個小遙控器」。你要的東西在那份清單的某處。大概吧。

[同一張照片] 辨識左上方、電池旁的小型黑色裝置。告訴我它的可能品牌和用途,用 2 句話。

主體(左上的黑色裝置)、動作(辨識品牌與用途)、格式(2 句話)。同一張照片,外科手術式的答案。

範例 2 —— 文件

[表格照片] 可以看一下這個嗎?

「看一下」不是任務。模型泛泛地摘要這張紙 —— 沒問題,除非你需要的是那個決定一切的欄位。

[同一張照片] 只讀這份合約頁面右上角方塊中的「生效日期」欄位並精確轉錄。如果無法辨認,就說「無法辨認」—— 不要猜日期。

文字欄位提示的尖峰:一個欄位、精確轉錄、外加明確的禁止猜測護欄 —— 因為一個無縫填補缺口的模型,正是未經猜測的法律日期最不該用的工具。

範例 3 —— 裝飾陷阱

[附上文章截圖] 摘要這個。

你剛為文字付了圖片價。模型讀取拼出單字的像素 —— 比你直接貼上那些字更慢、更貴、更容易錯。

[無圖片] 用 3 個項目符號摘要這篇文章:[貼上的文字]

相同的答案、一小部分的運算、零附件費用。截圖從來不是資料 —— 它是資料的容器。這一個習慣 —— 是文字就貼上,是像素才附加—— 是視覺提示中最大的節省。

常見陷阱

  1. 期望 AI「感受」圖片而不是閱讀它。 視覺模型不會體驗你的夕陽照;它從網格編目證據。問*「這喚起什麼情緒?」你會得到對慣例的自信描述 —— 暖色調、笑臉 —— 而不是被感動的反應。問圖片裡有什麼*,而不是看起來什麼感覺。
  2. 附加裝飾。 文字截圖、「供參考」的 logo、重複你已打過內容的照片。如果資訊已經是文字,每個附件都是花兩次的高級運算。只附加只有圖片能承載的東西。
  3. 模糊的指代 —— 「這個」、「它」、「那個部分」。 在文字聊天中,「它」指向上一則訊息。在圖片中,「它」指向一切。用名詞和位置:左邊的轉盤收據的第二行底部的紅線
  4. 在關鍵讀取上跳過禁止猜測護欄。 序號、日期、劑量、價格:視覺模型在不確定下填補缺口的能力和其他模型一樣流暢。加上*「精確轉錄;如果不清楚,說『無法辨認』」*—— 和幻覺課同一個租借誠實的技巧,現在有了眼睛。
  5. 一張圖、五個問題、一則訊息。 把「這是什麼、值多少、哪來的、是真的嗎、幫我寫賣場頁」綁在一起,會把注意力稀釋到整個網格五次。一次附件、一個尖銳問題 —— 然後追問;圖片留在桌上,後續搭著你已付費的 token 前進。

常見問題

我怎麼用圖片提示 AI?

點名主體、動作和任何可見文字,然後約束輸出:「辨識[圖片中位置的那個特定東西],[對它做這件事],以[格式]回答。」像指向同事的眼睛一樣指向模型的注意力 —— 對準貼紙,而不是整個廚房。

為什麼傳圖片給 AI 更貴?

因為模型必須先把圖片轉換成數百個視覺證據 token 才能處理你的問題 —— 遠比同等句子多的運算。在 Uzu 中,這個溢價是每檔固定 10 G-Credits:凝視所花 GPU 時間的誠實價格。文字便宜;像素要處理。

AI 能讀圖片裡的文字嗎?

能 —— 而且這是視覺模型最強的技能之一,從手寫到路牌到表格截圖。但要注意不確定下的準確度:任何關鍵內容(日期、序號、劑量)都要要求精確轉錄,並明確說「不清楚就說無法辨認」,而不是讓模型填補缺口。

下一課

注意貫穿這整課的東西:做了指向。你選主體、你引導注意力、你提供限制。但有一招能翻轉整個對話 —— 如果,不是回答問題,而是 AI 先問問題呢?機器訪談你的一個便宜回合,能取代你重新解釋的三個昂貴回合。

繼續下一課:「先問我」技巧

離開前的練習:找出你最後傳給 AI 的照片,用三種方式重問 —— 模糊、中等、外科手術式(主體 + 動作 + 文字 + 格式)。看答案每次如何變銳利,然後查一下模糊版實際花了你多少。