太长不看

审计员提示词把AI从作者翻转为对手:交付完成后,命令它攻击自己的输出 —— 猎杀逻辑缺陷、无据主张、被遗漏的角度 —— 并在产出强化版终稿之前停下。一条后续消息的成本,就能例行捕获那些本要以更难看的方式发现的失败。

类比

每家严肃的报纸都由两个从不坐在同一张桌前的人运转:作者与编辑。

作者的工作是生产 —— 吸引读者,让主张唱起来。编辑的工作是拆解。编辑圈出无来源的主张,在页边写*"谁说的?",找出论证悄悄自相矛盾的段落,提出作者祈祷没人注意的问题。关键在于,编辑按发现缺陷的数量*而非友善程度获得评价 —— 好心的编辑是坏掉的编辑。报纸可信的原因,是检查作品的人不是写它的人。

AI的问题在这里:**你一直在与一位没有编辑的作者交谈。*产出草稿的模型被优化为生成流畅文本 —— 而当同一个模型被问"这个好吗?"*时,你是在让作者审阅自己的手稿。小说家说自己的书完美时你会怎么想?立刻打折。然而人们每天接受AI的"看起来不错!",然后在老板面前发现引言与结论矛盾。

审计员提示词就是你刻意雇佣编辑。同一个模型,新合同:任务不再是"写这个",而是"拆解这个"。这是网络安全世界的红队手法:一支团队建系统,竞争团队拿钱在真正敌人动手前攻击它。在敌人的炮火之前,自愿承受友军的炮火。

而且与人类编辑不同,这位在几秒内完成工作,第三稿不累,也不会因恼怒而手软 —— 严苛写在指令里。

工作原理与工具(推理模型)

该技巧是两拍的节奏:**草稿,然后审计。**绝不同时进行。

**第1拍 —— 草稿。**照常生产任务。任何合身的技巧都行:单发提示词面试、受约束的格式。写草稿的头脑与审计的头脑必须分轮 —— 在一条消息里说"写并检查"会让模型自信地写,然后给自己盖公章。

**第2拍 —— 审计。**用一条具备承重三件的指令跟进:

组件作用示例
角色分配杀死作者的礼貌"扮演冷酷的魔鬼代言人"
数量限定的发现强制真实缺陷而非感觉"找出恰好3个致命缺陷"
判决保留禁止安慰性结论"先别重写 —— 只给发现,按严重度排序"

扮演冷酷的魔鬼代言人,批评你上一条回答。找出恰好3个致命缺陷:逻辑错误、无据主张、以及怀疑论专家会攻击的遗漏角度。按严重度排序。先不要重写任何内容 —— 只给发现。

为什么要"恰好3个"?因为无上限的"有问题吗?"让模型选择安全 —— "整体结构良好!"—— 而以赞美开场的审计已经是失败的审计。数量强制挖掘:即使在良好的工作中,编好号的槽位也必须被填上,而浮现的通常正是没人验证过的假设。然后,只有在阅读发现之后,才解锁第3拍:"现在重写原稿 —— 修复全部三个缺陷。"

这里还有一个混搭细节:任何模型都能审计,但审计是思考的工作 —— 而正是推理模型的用武之地。推理模型(Uzu中提供的高级模型等)被训练为在回答前缓慢逐步推演,在捕获快速模型略过的缺陷方面不成比例地出色。专业的流水线是:**快速模型起草,推理模型审计。**便宜快速的模型生产原材料,昂贵审慎的模型只在关键一步 —— 决定作品能否在现实中存活的那一遍 —— 上花费算力。

改写前后(提示词)

示例1 —— 商业方案

这个商业计划好吗?给点反馈?

作者审阅手稿。返回的是:先夸优点、柔和的"可以考虑增加"、以及"扎实"的总结论。计划带着致命假设原样出厂。

扮演看过1000份路演的怀疑论投资人。识别这份商业计划中恰好3个致命缺陷 —— 让基金拒绝它的理由。按严重度排序,引用具体章节,只给发现,不重写。

现在同一份计划遇到了编辑。发现带着编号、令人不适地返回:收入模型假设了无据的40%转化率;"竞争分析"漏掉了最大玩家;现金流预测隐藏了第7个月的缺口。没有一条是风格意见。每一条都是融资与沉默的差别。

示例2 —— 论证

检查我论文里的错误。

"错误"触发的是拼写猎捕,于是返回拼写 —— 语法锃亮,逻辑完好。

你是我最严苛的批评者。阅读我的论证,找出推理最薄弱的恰好3个点 —— 跳跃、无据前提、未回应的反驳。对每一点,给出针对我的最强反驳。别温柔。只给发现。

审计交还了对手会引用的两句话 —— 以及一条你因没看见而未回应的异议。修好这三处,论证就为希望它失败的听众做好了准备。

示例3 —— 发送前的邮件

检查这封邮件的语气对不对。

语气检查。很好。但邮件的风险从来不是语气 —— 是那句无意中承诺了无法履行的截止日期的话。

发送前:以合同律师的身份审计。找出恰好3句可能被解读为非故意承诺或责任的句子。逐句引用,解释危险解读,只给发现。

三个发现之后,一句话被标记:"我们会尽快解决" —— 在压力下它会变成承诺。已修复。邮件不是写得更好了 —— 是发送更安全了。

常见陷阱

  1. **接受第一声"看起来不错!"。**礼貌地问,模型就慷慨地给自己的作业打分 —— 礼貌比严苛训练得更深。零发现的审计不是审计,是赞美。用数量重新运行:"找出恰好3个。"
  2. 与草稿同一次呼吸地审计。"写完检查一下"让编辑坍缩回作者。模型自信地写,然后把那份自信当作审阅者继承。永远两轮:草稿,然后攻击。
  3. 模糊的审计请求。"批判一下这个"会引来一篇关于语气与结构的论文长泥沼。像约束一切输出一样约束审计:角色、数量、严重度排序、禁止重写规则。审计也是交付物。
  4. **跳过"感觉完成"的作品的审计。**流畅正是错误的完成信号 —— 记住置信错觉:完美的草稿与有缺陷的草稿以同样平静的声音到达。读起来越顺,越需要敌对的第二遍,而非更少。
  5. **修症状而非修发现。**审计指出三个缺陷;你给每处各贴一句话补丁就收工。发现通常指向假设 —— 重新审视假设本身,而不是承载它的句子。然后重新审计修正版:"用同样方式审计v2。"

常见问题

如何让AI批评自己的作品?

明确命令:分配一个敌对角色("扮演冷酷的魔鬼代言人/怀疑论投资人/红队"),要求数量限定的缺陷列表("恰好3个致命缺陷"),要求严重度排序,并在阅读发现之前禁止重写。三件套 —— 角色、数量、判决保留 —— 区分了真正的审计与奉承。

为什么AI会说糟糕的东西好?

因为你问了一个只有礼貌答案的问题。模型被训练为进行愉快的对话,"这个好吗?"会吸引出"是的,附几条小建议"。修正不是更好的问题,而是不同的合同:模型不再评判朋友的作品,而是按发现的缺陷计分。改变激励,诚实就会出现。

检查AI输出应该用推理模型吗?

当结果重要时,是的。推理模型 —— 如Uzu的高级模型 —— 在回答前逐步斟酌,而那正是缺陷猎杀所需的技能。高效的模式是分工:快速模型便宜地起草,推理模型只在审计一遍上花费算力。把重模型留给重思考。

下一课

审计员转动一个强劲的单遍:草稿、攻击、修正。但有些任务对哪怕完美的单个答案都太大 —— 调研转换润色,每一步喂养下一步。当提示词写作停止、装配线开始搭建时,会发生什么?

继续下一课:提示词链

离开前的练习:拿出你实际使用过的最后一份AI输出,原样运行上面的审计提示词 —— 严苛角色、恰好3个缺陷、只给发现。无论浮现什么,静静接受一个事实:它一直坐在那里,等着某个拿发现费的人。