摘要:大模型会一本正经地编出不存在的论文、法条、数据和链接,这就是“幻觉”。本文列出最容易出现幻觉的 6 类场景,给出能降低幻觉的提问方法,以及交付前逐条过一遍的核查清单。

大模型的工作方式,是根据上下文生成“最可能的下一个词”,而不是去数据库里查一个确定的答案。所以当它不知道的时候,经常不会说“不知道”,而是生成一段听起来很对的内容。这就是幻觉。

6 类高风险场景

场景常见的幻觉
引用文献、论文作者、标题、年份看起来都对,但文章根本不存在
法律法规条款编号对不上,或者引用已经废止的规定
数字和统计编出具体的百分比、金额、排名
最新信息用过时的知识回答最近的事,比如价格、政策、产品版本
链接和网址生成一个格式正确但打不开的 URL
人物和机构把两个人的经历混在一起,或者给公司安上不存在的产品

越是具体、越像“硬知识”的内容,越需要核查。

提问时就降低幻觉

  1. 给材料,让它基于材料回答:“只根据下面的文档回答,文档里没有的就说没有。”
  2. 允许它说不知道:“如果你不确定,请直接说不确定,不要猜。”
  3. 要求标出处:“每个结论标出来自原文的哪一段。”然后自己去对照。
  4. 拆小问题:一次问一件事,比一次问十件事准确。
  5. 用联网搜索功能:查新信息时开启搜索,并点开它给的来源看一眼。
  6. 交叉验证:同一个关键问题,换个问法再问一次,或者换一个模型问,答案不一致的地方重点核查。

交付前的核查清单

写报告、发文章、给客户发资料之前,逐条过一遍:

  • □ 所有数字都能找到原始出处吗?
  • □ 引用的论文、书籍,在学术数据库或出版社网站能搜到吗?
  • □ 引用的法规条文,在官方数据库(如国家法律法规数据库)核对过原文和是否现行有效吗?
  • □ 所有链接都点开检查过吗?
  • □ 人名、机构名、产品名拼写正确吗?
  • □ 涉及时间的信息,是最新的吗?
  • □ 有没有模型“替你”下的结论,而你自己并不认同?

哪些事别交给 AI 做最终判断

医疗诊断、法律意见、投资决策、涉及安全的操作步骤。AI 可以帮你整理问题、查资料、准备和专业人士沟通的清单,但最后的判断要由专业人士和你自己来做。

相关阅读