TL;DR

Auditor 提示把 AI 從作者翻轉為對手:在它交付後,你命令它攻擊自己的輸出—— 獵捕邏輯缺陷、無支撐的主張和遺漏的角度 —— 然後產出一份強化的最終版本。它花一則後續訊息,而且經常抓到你原本會用慘痛方式發現的失敗。

類比

每家認真的報社都靠兩個永遠不坐同一張桌子的人運作:作者與編輯。

作者的工作是生產 —— 帶著讀者前進、讓論述發光。編輯的工作是拆除。編輯圈出沒有來源的主張、在頁邊寫*「誰說的?」、找出論述悄悄自相矛盾的那一段、問作者希望沒人注意到的問題。關鍵是,編輯以找到的缺陷*計分,而不是以友善 —— 溫和的編輯是壞掉的編輯。報紙可信,正是因為檢查它的人不是寫它的人。

AI 的問題在這裡:你一直在跟一個沒有編輯的作者說話。 產出你草稿的模型是為了產出流暢文字而最佳化的 —— 而當你問同一個模型*「這樣好嗎?」*,你是在請作者審自己的稿。如果一位小說家告訴你他的書無懈可擊,你會立刻打折扣。但人們每天接受 AI 的「看起來很棒!」—— 然後在老闆面前發現引言和結論互相矛盾。

Auditor 提示就是你刻意雇用編輯。 同一個模型,新合約:工作不再是「寫這個」—— 工作是「弄壞這個」。這是資安界的紅隊手法:一組人蓋系統,另一組人收錢在真正的對手之前攻擊它。友軍火力,刻意的,在不友善的那種抵達之前。

而且和人類編輯不同,這位在幾秒內完工、永遠不會對你的第三稿厭倦、也不會被冒犯到放軟 —— 因為嚴厲是你寫進指示裡的。

運作原理與工具(推理模型)

這個技巧是兩步節奏:先草稿,後審查。 永遠不要同時。

步驟 1 —— 草稿。 用任何適合的技巧正常產出作品:one-shot 提示訪談、受限格式。起草的腦和審查的腦必須分開輪流 —— 在一則訊息裡被要求「邊寫邊檢查」的模型,會自信地寫完然後給自己蓋章。

步驟 2 —— 審查。 用一個有三個承重部分的命令跟進:

部分它做什麼範例
角色指派消滅作者的客氣「扮演無情的魔鬼代言人」
計數發現強迫真缺陷,不是感覺「找出恰好 3 個致命缺陷」
保留判決禁止撫慰性的結論「先不要改寫 —— 只要發現,按嚴重度排序」

扮演無情的魔鬼代言人,批評你先前的答案。找出恰好 3 個致命缺陷:邏輯錯誤、無支撐的主張、或懷疑論專家會攻擊的遺漏角度。按嚴重度排序。先不要改寫任何東西 —— 只要發現。

為什麼「恰好 3 個」?因為不設上限的「有問題嗎?」會邀請模型表演安全 —— 「整體結構良好!」—— 而以讚美開場的審查是已經失敗的審查。計數強迫挖掘:即使作品很好,編號欄位也必須被填滿,而浮上來的通常是沒人檢查過的假設。然後,只有在讀完發現之後,你釋放步驟三:「現在改寫原稿,修正全部三個缺陷。」

這也是混合策略的細膩之處:任何模型都能審查,但審查是思考工作 —— 而正是推理模型的專長。推理模型(如 Uzu 提供的高級型號)被訓練在回答前慢下來逐步思考,這讓它們格外擅長抓到快速模型滑過去的缺陷。於是專業管線出現:快速模型起草,推理模型審查。 便宜、迅速的模型產生原材料;昂貴、深思熟慮的模型把火力只花在關鍵的那一關 —— 決定作品能否在現實中存活的那一關。

改寫前後(提示)

範例 1 —— 商業計畫

這份商業計畫好嗎?有什麼回饋嗎?

作者審自己的稿。回來的是:先講優點、一句溫和的「考慮加入」、整體紮實的判決。計畫帶著致命假設完好無損地出貨。

扮演一位看過 1,000 份提案的懷疑論投資人。找出這份商業計畫中恰好 3 個致命缺陷 —— 公司會拒絕的理由。按嚴重度排序,引用具體章節,只要發現,不要改寫。

現在計畫面對的是編輯。發現回來了,有編號而且不舒服:收益模式假設 40% 轉換率卻零證據;「競爭者分析」漏掉最大玩家;現金流預測在第七個月藏了一個缺口。這些都不是風格建議。全部都是拿到資金與沉默之間的差別。

範例 2 —— 論證

檢查我的文章有沒有錯誤。

「錯誤」是抓錯字,所以那就是你得到的 —— 文法修好了,邏輯沒動。

你是我最嚴厲的評論家。讀我的論證,找出推理最薄弱的恰好 3 個地方 —— 跳躍、無支撐的前提、或我沒回應的反對意見。針對每一項,說出對我最強的反論。不要放軟。只要發現。

審查回傳了對手會引用來對付你的那兩句話 —— 以及那個你從未反駁、因為你從未看見的反對意見。修正那三個,論證就準備好面對希望它失敗的聽眾。

範例 3 —— 寄出前的信

確認這封信語氣對。

語氣檢查。很好。但這封信的危險從來不是語氣 —— 是那句不小心讓你承諾了你做不到的期限的句子。

寄出前:以合約律師身分審查它。找出恰好 3 個可能被解讀為我無意的承諾或責任的敘述。引用每一句,解釋危險的解讀,只要發現。

三個發現之後,一句話被標記:「我們很快會解決這件事」—— 在壓力下,它變成承諾。它被改寫了。這封信從來不是寫得更好。它是寄起來更安全

常見陷阱

  1. 接受第一個「看起來很棒!」。 如果你客氣地問,模型會大方地給自己的作業打分 —— 客氣被訓練得比嚴謹更深。回傳零個發現的審查不是審查;是恭維。用計數重跑:「找出恰好 3 個。」
  2. 起草的同時審查。 「寫完並確認它很好」把編輯塌縮進作者。模型自信地起草,然後把那份自信繼承為自己的審查者。永遠兩個回合:先草稿,然後攻擊。
  3. 模糊的審查請求。 「批評這個」邀請關於語氣和結構的作文泥漿。像約束任何輸出一樣約束審查:一個角色、一個計數、一個嚴重度排序、一條禁改寫規則。審查也是交付物。
  4. 對「感覺完成了」的作品跳過審查。 流暢正是錯誤的完成訊號 —— 記得自信的錯覺:無瑕動聽的草稿和有缺陷的草稿用同樣平靜的聲音抵達。讀起來越好,你越需要敵意的第二關,而不是越少。
  5. 修症狀而不修發現。 審查點名三個缺陷;你各補一句就以為完了。發現通常指向一個假設—— 重新檢查它,而不只是承載它的句子。然後對修訂版再審:「用同樣方式審查 v2。」

常見問題

我怎麼讓 AI 批評自己的作品?

明確命令:指派敵意角色(「扮演無情的魔鬼代言人/懷疑論投資人/紅隊」)、要求計數的缺陷清單(「恰好 3 個致命缺陷」)、要求嚴重度排序,並在你讀完發現前禁止改寫。三部分結構 —— 角色、計數、保留判決 —— 是真正審查與恭維的分界。

為什麼 AI 說我的作品好但其實不好?

因為你問了一個只有一個客氣答案的問題。模型在討人喜歡的對話上訓練,所以「這樣好嗎?」傾向「好,附小建議」。修正不是更好的問題 —— 是不同的合約:模型不再是在評朋友的作業,而是以找到的缺陷計分。改變誘因,誠實就出現。

我該用推理模型檢查 AI 輸出嗎?

對任何重要的事,是。推理模型 —— 如 Uzu 的高級型號 —— 在回答前逐步深思,而那正是獵捕缺陷所需的技能。有效率的模式是分工:快速模型便宜地起草,然後推理模型只把運算花在審查關。把重模型留給重思考。

下一課

Auditor 跑一個強力循環:草稿、攻擊、修正。但有些工作連完美的單一答案都裝不下 —— 研究然後轉換然後潤飾,每一步餵養下一步。當你停止寫提示、開始蓋生產線,會發生什麼?

繼續下一課:提示鏈結

離開前的練習:拿你最後一個真正用過的 AI 輸出,對它跑上面的精確審查提示 —— 無情角色、恰好 3 個缺陷、只要發現。無論浮出什麼,細細體會:它一直都在那裡,等著有人被雇來找到它。