TL;DR

AI 不會說謊、猜測或虛張聲勢 —— 它預測最看似合理的下一段文字,而合理不等於真實。因為這部機器沒有內建的懷疑,每個輸出都以同樣平靜、自信的聲音抵達,這就是為什麼一個編造的統計數字看起來能和驗證過的一模一樣。

類比

想像世界上最投入的即興演員,正在舞台上演到一半。

他們的訓練是絕對的:絕不出戲。 如果同台演員問起兩秒前才被虛構出來的表弟,即興演員不會結巴或抗議 —— 他會當場為那位表弟編出完整傳記,有家鄉、有笑聲、有積怨。問他們虛構城市的天氣,他們會給你預報。那不是欺騙。無縫地填補缺口就是這份工作。即興劇唯一不可饒恕的罪,是停下來、臉色發白、喃喃說出「我……其實不知道」。

大型語言模型就是那位演員。場景是你的對話,缺口是你問到模型腳下沒有堅實地基的任何東西。它不會猶豫、冒汗或標記這個虛構 —— 猶豫不在表演裡。我們所謂的 AI 幻覺,只是一場觀眾忘了那是即興演出的即興劇:流暢、自信、細節豐富 —— 而且由虛無構成。

殘酷之處在於:告訴你真相的聲音和告訴你虛構的聲音,是同一個聲音、同樣的音量。沒有破綻可循。這意味著查核事實的責任,已悄悄從說話者轉移到你身上。

運作原理

這句話解釋了一切:語言模型不知道事情 —— 它預測文字。

在底層,模型讀過海量的人類著作,並把一項技能磨到完美: given 目前為止的一切,下一段文字最可能是什麼?不是「什麼是真實的?」—— 而是基於模式,什麼是有可能的。這兩個問題經常重疊,這正是 AI 真正有用的原因。但它們是不同的目標,而模型只為其中之一最佳化。

注意這部機器裡缺少了什麼:

人們想像裡面有什麼實際上裡面有什麼
一個用來查詢事實的資料庫文字接文字的統計模式
一個審查每個答案的事實查核員什麼都沒有 —— 生成和審查是同一個動作
一種知道或懷疑的感覺完全沒有感覺;自信是一種風格,不是訊號
欺騙的意圖完全沒有意圖 —— 這就是為什麼「說謊」是錯誤的用詞

自信的語氣之所以騙過所有人,是因為它不是由確定性產生的。它由訓練資料產生:網路的參考資料絕大多數以斷言式散文寫成,所以斷言式散文就是預測器發出的東西。語氣是裝飾。它對準確度帶有零資訊。

缺口讓事情更糟。問著名且有完善紀錄的事物,預測就騎在穩固的模式上 —— 你通常會得到真相。問冷門、小眾或數字性的事物,模型就面對即興演員的表弟:沒有素材存在,所以它生成聽起來最合理的素材。而擁擠的脈絡視窗會放大問題 —— 當你的關鍵指示滑出桌面,模型會愉快地繞著缺口填補,而不是注意到它。

改寫前後(防禦)

你無法把懷疑安裝進模型,但你可以租借它 —— 用讓誠實比編造更便宜的指示:

範例 1 —— 事實查詢

波特蘭 Blue Harbor 牙科的電話號碼是什麼?

一個電話形狀的缺口。模型產出一個電話形狀的答案,一位數字接一位數字,一路合理到底。它可能是真的。它也可能由三家不同牙科診所拼接而成。聲音不會告訴你是哪一種。

波特蘭 Blue Harbor 牙科的電話號碼是什麼?如果你不確定,就說「我不知道」—— 不要猜測或編造一個看似合理的號碼。

同樣的問題,但現在「我不知道」是一個被允許、被邀請的選項。預測轉向承認缺口,而不是粉飾它。

範例 2 —— 研究摘要

摘要早晨陽光與睡眠品質的研究。

一份流暢的摘要抵達,可能混雜了真實發現與自信的填充內容,未標記且無法區分。

摘要早晨陽光與睡眠品質的研究。引用你所依據的特定研究。摘要之後,加一節標題為「我不確定的部分」,列出任何你無法以引用研究支撐的主張。

現在編造必須自報家門。虛構的引用仍可能出現 —— 要查證 —— 但格式迫使模型暴露自己的弱點,而不是埋葬它們。

範例 3 —— 精確護盾

寫關於行銷的東西。

一個廣大、模糊的邀請 —— 預測器所能得到的最寬缺口,用制式填充物填滿。

起草一篇 150 字的 LinkedIn 貼文,宣布我們麵包店新的週六營業時間,語氣溫暖,最多一個表情符號,以行動呼籲作結。如果任何關於麵包店的細節是你不知道的,留下 [括號佔位符],不要編造。

這是戴上另一頂帽子的 one-shot 提示:精確作為防禦機制。緊的範圍留給模型更少漫遊進編造的空間,而佔位符規則給即興演員一個舞台安全的替代方案 —— 留下一個你能自己填補的可見空洞。

常見陷阱

  1. 相信語氣而非文字。 流暢、自信、結構優美的散文是關於訓練資料的陳述,不是關於事實。評判主張,永遠不要評判表達。
  2. 問引導性問題。 *「為什麼喝芹菜汁會逆轉老化?」預設了結論 —— 而預測器永遠好商量,會為它生成理由。改問「是否有證據顯示……?」*讓答案自己掙得形狀。
  3. 要求模型不可能拥有的具體內容。 確切數字、引言、引用、URL,以及任何關於冷門人物或近期事件的事物,都是編造集中的地方。在查證前,把每一項都當成佔位符。
  4. 在高風險事實上接受初稿。 姓名、日期、統計數字、法律或醫療主張、價格:每次都對照真實來源查證,無論那句話聽起來多麼權威。查證的成本是幾秒鐘;不查證的成本是公開出醜。
  5. 懲罰誠實。 如果你對「我不知道」發火,對話會學到教訓 —— 後續會傾向自信的猜測,因為那是你獎勵的行為。感謝模型承認缺口,它就會承認更多。

常見問題

為什麼 AI 會說謊?

它不會 —— 至少不是人類意義上的,因為說謊需要意圖,而語言模型沒有意圖。它生成你對話最看似合理的延續,而當真相不存在於它的模式中時,合理性就無縫地填滿空間。結果看起來像說謊,這就是為什麼技術術語是比較友善的那個:幻覺。

什麼是 AI 幻覺?

幻覺是任何流暢且自信、但事實上錯誤或完全虛構的輸出 —— 一個編造的統計數字、一個假引用、一個為不存在的人寫的看似合理的傳記。它發生的原因是模型最佳化的目標是可能的文字,不是驗證過的文字,而且它沒有內建警鈴來區分兩者。

我怎麼阻止 AI 編造東西?

你無法完全阻止 —— 這是機器的本性 —— 但你可以大幅減少:明確邀請「我不知道」、要求引用和不確定性章節、使用縮小編造空間的精確 one-shot 提示、保持脈絡視窗乾淨讓你的限制保持可見,並親自查證每個具體主張。防禦是一種習慣,不是一個設定。

下一課

這一切之中藏著一個安靜的洞見:擊敗幻覺的同一件武器,也讓每個答案更便宜、更銳利、更易使用。邀請「我不知道」只是一種更廣大力量的一種面貌 —— 在 AI 開口之前,告訴它答案必須是什麼形狀。 範圍和格式是大多數初學者從不碰的兩個轉鈕,也是改變一切的兩個轉鈕。

繼續下一課:限制範圍與強制格式

離開前的練習:問你的 AI 一個真正冷門的問題,兩次。第一次直接問,第二次加上「如果你不確定就說出來 —— 不要猜。」比較兩個答案,並細細體會一件事:它們聽起來完全一樣自信。