如何让AI诚实地反对你
初级7 分钟阅读提示词工程

如何让AI诚实地反对你

五种实用的提示方法,可以让一味附和的AI提出更有价值的质疑,同时避免把模型生成的反驳误当成证据。

您应该能够做到的事情

不要只笼统地要求AI少些附和。应隐藏自己的偏好,把不同角色拆到独立轮次,要求列出证据,再比较各轮结果。

仅在此浏览器中保存。
本文内容

“挑战我的想法”听起来像一条强提示。

结果往往并不理想:三条客气的保留意见,一句夸你考虑周到的话,最后仍是你最初提出的那条建议。

问题是结构性的。模型已经见过你的框架、你偏好的答案,以及你常常希望它批评的论证。要求它“更批判”并不能去掉这些信号。

要得到有用的反对意见,关键在于改变模型能看到哪些信息,以及按什么顺序看到。

以下五种模式是做到这一点的实用方法。没有一种会把聊天机器人变成独立专家。每一种都让某一种失效更容易被看见。

模式1:隐藏偏好

偏好线索会招来附和。去掉它们。

弱提示:

我想让团队从工具A迁移到工具B。
帮我对这个计划做压力测试。

模型知道哪个结论在社交上更有帮助。

更强的提示:

一个十人团队在比较两个选项。

选项A
- [当前事实]
- [成本]
- [约束条件]

选项B
- [当前事实]
- [成本]
- [约束条件]

不要推荐选项。
对每一个,指出:
1. 它可能失败的最强理由,
2. 最重要的缺失证据,
3. 在什么条件下它会成为更好选项。

不要写“我们现有的系统”或“更现代的替代方案”。哪怕只是一个简短标签,也可能暗含结论。

何时有帮助

  • 供应商选择;
  • 招聘还是外包;
  • 自研还是采购;
  • 保留还是替换某个流程;
  • 或任何你已有偏爱的选择。

这种方法不能解决什么

事实仍由你选择。即使隐藏了偏好,你省略的信息依然可能让比较产生偏差。

模式2:分开倡导者与批评者

单次回答往往会折中处理:提出一个论点,补上一项保留意见,再给出一个看似平衡的结论。

用不相容的任务做分开的轮次。

轮次A:

为选项A建立最强的基于证据的论证。
不要讨论选项B。
陈述每一个假设,并指出证据缺失之处。

轮次B,在新聊天中:

为选项B建立最强的基于证据的论证。
不要讨论选项A。
陈述每一个假设,并指出证据缺失之处。

轮次C:

比较这两份论证。

不要奖励文采或篇幅。
列出:
- 由已提供事实支撑的主张,
- 需要外部核验的主张,
- 相互冲突的假设,
- 以及能降低最大不确定性的一个实验。

[粘贴两份论证]

分开的对话可以减少上下文造成的锚定效应。它们不会创造真正的独立性,因为不同轮次仍可能沿用相似的训练模式,但至少能避免第二个角色只针对第一个角色的措辞作出反应。

模式3:先要求证据,再谈论证

如果先要求一套有说服力的论证,模型可能会先生成符合结论的主张,再事后补上支持材料。

颠倒顺序:

在形成观点之前,创建证据表。

对每个决策标准,记录:
- 已提供事实,
- 需要的一手来源,
- 估计及其假设,
- 未知项,
- 以及能证伪每个选项的证据。

在我核验并返回证据表之前,不要推荐任何东西。

核验之后,只提供修正后的表,再要求分析。

这比索要即时推荐更慢。当答案事关重大时,这是优点。

一条有用的停止规则

如果最大的未知因素足以推翻整个决定,就不要索要最终建议。应设计测试、收集测量结果,或咨询掌握缺失信息的人。

模式4:指定审查范围明确的反方审阅者

“当魔鬼代言人”太模糊。给审阅者一个具体的失效面。

示例:

只从运营失效角度审阅这份计划。
假定策略本身合理。
找出所有权、监控、回滚或维护缺失之处。
只从受影响员工的视角审阅这份提案。
指出哪些所谓好处其实是管理层的好处,而不是员工的好处。
标出公司无法核验或无法兑现的承诺。
只从隐私暴露角度审阅这条数据流。
列出每一数据类别、目的地、保留点,以及有权访问的人。
不要提供法律结论。

范围明确的反方审阅,比夸张的攻击性语气更有用。“残酷地诚实”只能改变语气,明确审查对象才能改变覆盖范围。

当利害关系值得时,可进行多个范围狭窄的审阅。在你判定哪些风险真实之前,让各审阅的发现保持分开。

模式5:使用独立的第二轮

把同一份中立简报跑过:

  • 一次没有历史的新对话;
  • 第二个模型族;
  • 或一位未见偏好答案的人类审阅者。

然后比较分歧:

两位审阅者分析了同一决策。

审阅者1:
[粘贴]

审阅者2:
[粘贴]

创建分歧登记表:
- 议题,
- 每位审阅者的主张,
- 各自依赖的证据,
- 缺失证据,
- 以及能解决它的负责人。

不要根据自信度或写作质量选择赢家。

两个模型得出一致结论,并不等于结论已被证实。模型可能共享来源、惯例和盲点。真正有用的是分歧登记表,以及它指出还需收集哪些证据。

示例演练:自动化发票处理

假设初始计划是:

我们应该用AI智能体读取供应商发票、录入会计软件,并将其转入付款流程。

一般的挑战提示可能返回关于准确性和人工监督的可以预见的附带说明。

改用五种模式。

1. 中立化选项

  • 选项A:保留人工录入并改进清单。
  • 选项B:使用确定性提取加人工审核。
  • 选项C:使用能提取、录入并流转付款的智能体。
  • 选项D:推迟项目,先标准化供应商格式。

2. 分开倡导者

每个选项获得各自最强论证与明确假设。

3. 建立证据表

收集:

  • 每月发票量;
  • 当前处理时间;
  • 纠正率;
  • 标准格式占比;
  • 重复或欺诈发票的价值与频率;
  • 集成权限;
  • 以及由谁负责处理例外情况。

4. 进行范围狭窄的反方审阅

  • 财务控制;
  • 运营恢复;
  • 供应商隐私;
  • 以及员工工作流。

5. 比较独立轮次

一位审阅者可能聚焦人力节省。另一位可能注意到当前流程缺少可靠的采购订单匹配,使自动化为时过早。

最好的结果可能不是得到一套更有力的支持或反对AI的论证,而是进行为期两周的测量,让答案变得清楚。

三种看似反对、实则无效的情况

模型编造异议

并非每条反驳都站得住脚。应要求模型说明这条异议针对的是哪项假设或证据。

模型刻意追求表面对称

有些选项并非势均力敌,其中一个可能有强得多的证据。不要要求正反论点数量相等,而应要求找出实质性问题。

模型变成自信的唱反调者

提示可以让模型反对一切。唱反调输出仍是生成输出。它需要与附和输出相同的核验。

研究已经记录多种AI助手的迎合行为,并说明偏好信号如何影响模型回答(Anthropic关于迎合行为的研究)。应对方法不是一句神奇的提示词,而是一套减少偏好暗示、让证据清晰可见的流程。

可直接复制的异议序列

对重要决策使用此序列:

阶段1:框架
用三种实质不同的方式重述问题。
不要解决它。

阶段2:证据
分开已提供事实、可核验事实、估计、推断与价值观。
列出可能推翻决策的证据。

阶段3:论证
分别为每个选项建立最强论证。
陈述假设与失效条件。

阶段4:审阅
对运营、受影响的人、安全/隐私与成本做狭窄审阅。

阶段5:决策支持
创建分歧登记表,并提出最小的真实世界测试。
不要做最终决策。

支撑此序列的失效模式,见AI思考伙伴扭曲决策的四种方式。更广工作流见用AI做出更好的决策

诚实的限度

你可以让AI产出异议。你不能让它知道你错了。

模型可能从不同角度生成同一有缺陷假设。它可能引用过时来源。它可能听起来独立,只因为你改了角色标签。

把反对意见当作搜索工具:它可以揭示假设、被忽略的利益相关者,以及仍需收集的证据。最终判断仍应由理解具体情境并承担后果的人作出。

继续阅读

通过下一篇文章继续沿着相同的学习路径进行学习。