太长不看

AI不会说谎、瞎猜或虚张声势 —— 它预测的是最貌似可信的下一段文本。而"貌似可信"与"真实"不是一回事。怀疑机制并未内置于其中,所以每个输出都以同样平静自信的声音到达,编造的统计数据与验证过的看起来一模一样。

类比

想象世界上沉浸感最强的即兴演员正处在舞台场景中。

他的训练是绝对的:**绝不脱离角色。**两秒前提到一个虚构的表弟,即兴演员不会结巴或反驳 —— 他当场编出完整的履历,包括老家、笑声和世仇。问他一座虚构城市的天气,他会给出天气预报。那不是欺骗 —— 无缝填补空隙正是他的工作。即兴表演中唯一不可饶恕的罪,是停下来、脸色发白地低语:"其实……我不知道。"

大语言模型就是那位演员。场景是你的对话,空隙是模型没有扎实依据作答的所有问题。它不会犹豫,不会冒汗,不会给编造贴上标记 —— 犹豫不在节目单里。我们所说的AI幻觉,只是观众忘了那是即兴表演的即兴场景:流畅、自信、细节丰富 —— 而且凭空捏造。

残酷的转折:说真话的声音和说编造内容的声音是同一个声音、同样的音量。没有任何线索可区分。也就是说,事实核查的责任已悄然从说话者转移到你身上。

工作原理

一句话解释一切:语言模型不认识事物 —— 它预测文本。

在底层,模型阅读了海量的人类文字,并完美掌握了一项技能:在给定之前所有内容的情况下,哪段文本最貌似可信地接续下去?不是"什么是真实的" —— 而是基于模式的"什么是看似合理的"。这两个问题不断重叠。所以AI才真正有用。但目标不同,而模型永远只为其中之一优化。

这台机器所缺少的:

人们以为里面有的实际在里面的
可查询的事实数据库词接词的统计模式
审阅答案的事实核查员没有 —— 生成与审阅是同一个动作
知道或怀疑的感觉没有任何感觉。自信是一种文体,不是信号
欺骗的意图没有意图 —— 所以"说谎"是个错误的词

自信的语气之所以能骗过所有人,是因为它并非源自确信。它源自训练数据:互联网上的参考文献压倒性地以断定式散文写成,于是预测器输出的也是断定式散文。语气是装饰。它不携带任何关于准确性的信息。

空隙让情况更糟。问著名且被充分记录的事物,预测会运行在坚实的模式上 —— 通常得到事实。问冷门的、小众的、数字性的东西,模型就遇到了即兴演员的表弟:素材不存在,于是它生成最貌似可信素材。而拥挤的上下文窗口会放大问题 —— 当关键指示从桌面滑落时,模型不去填补空隙,而是填补空隙的周围。

改写前后(防御手段)

你无法把怀疑写进模型,但可以租借它 —— 用让诚实比编造更便宜的指令:

示例1 —— 事实查询

波特兰的Blue Harbor Dental的电话号码是多少?

一个电话号码形状的空隙。模型生成一个电话号码形状的答案,逐位展开,直到结尾都貌似可信。可能是真的。也可能是从三位牙医那里拼接的。声音不会告诉你答案。

波特兰的Blue Harbor Dental的电话号码是多少?如果不确定,请说"我不知道" —— 不要猜测,不要构造貌似可信的号码。

同一个问题,但现在"我不知道"是一只被允许并受欢迎的手。预测从掩盖空隙转向承认空隙。

示例2 —— 研究总结

总结一下关于晨光与睡眠质量的研究。

一份流畅的摘要会到达。其中可能混杂着真实的发现与貌似可信的填充物。你无法分辨。

总结关于晨光与睡眠质量的研究,并引用你依据的具体研究。总结之后,加一节"不确定之处",列出引用研究无法支持的主张。

现在编造必须自我申报。捏造的引用仍有可能 —— 请验证 —— 但格式迫使模型暴露弱点,而不是填埋它。

示例3 —— 精确之盾

写点营销内容。

一个巨大而模糊的邀请 —— 预测器用通用填充物填充的最宽空隙。

为我们烘焙店的新周六营业时间起草一条150词的LinkedIn帖子。语气温暖,表情符号最多1个,以鼓励到店收尾。关于烘焙店不确定的细节,不要编造,留下[括号占位符]。

这是换了顶帽子的单发提示词:作为防御机制的精确。狭窄的范围减少了发明的漫游空间,而占位符规则给了即兴演员一个舞台安全的替代品 —— 一个留给你填的可见空洞,而不是编造。

常见陷阱

  1. **信任语气而非文本。**流畅、自信、结构优美的文字,是关于训练数据的陈述,而非关于事实。审判主张,永远不要审判交付方式。
  2. 提出诱导性问题。"为什么芹菜汁能逆转衰老?"预设了结论 —— 而永远和气的预测器会生成原因。改问"有什么证据表明……?",让答案自行成形。
  3. **要求模型不可能具备的特异性。**精确数字、引用、参考文献、URL,以及关于冷门人物或近期事件的一切 —— 发明正集中于此。在验证之前,把每一项都当作占位符对待。
  4. **照单全收初稿中的高风险事实。**名字、日期、统计数据、法律/医疗主张、价格:无论句子听起来多么权威,每次都与实际来源核对。验证的成本是几秒钟。不验证的成本是公开的。
  5. **惩罚诚实。**对"我不知道"发火,对话就会学到教训 —— 后续回答将偏向自信的猜测,因为那才是你奖励的。感谢它承认空隙,模型就会更常承认。

常见问题

为什么AI会说谎?

它没有 —— 在"说谎需要意图、而语言模型没有意图"的意义上。它生成对话最貌似可信的延续,当真实在模式中不可得时,貌似可信就无缝填补空隙。其结果看起来像谎言。所以技术术语更仁慈:幻觉。

什么是AI幻觉?

幻觉是流畅、自信但在事实上错误或完全编造的输出 —— 捏造的统计数字、虚假引用、不存在的人的貌似可信的履历。它发生的原因是模型针对"貌似可信"而非"已验证"的文本优化,且没有区分两者的内部警报。

如何阻止AI说谎?

无法完全阻止 —— 这是机制的属性 —— 但可以大幅减少:明确欢迎"我不知道",要求引用与不确定性章节,使用缩小发明空间的精确单发提示词,保持上下文窗口干净使约束持续可见,并亲自验证每一个具体主张。防御不是设置,而是习惯。

下一课

这一切中隐藏着一个安静的洞察:打败幻觉的武器,同样让每个答案更便宜、更锐利、更可用。欢迎"我不知道"只是更大力量的一个味道 —— **在AI开始说话之前,准确告诉它答案必须长什么样。**范围与格式是大多数初学者从不触碰的两个旋钮,也是改变一切的两个旋钮。

继续下一课:范围限制与格式强制

离开前的练习:向AI问两次某个真正冷门的东西。一次照常,一次附加"如果不确定就直说 —— 不要猜"。对比两个答案,并静静接受一个事实:其中的事实听起来有着完全相同的自信。