摘要:大模型会一本正经地编出不存在的论文、法条、数据和链接,这就是“幻觉”。本文列出最容易出现幻觉的 6 类场景,给出能降低幻觉的提问方法,以及交付前逐条过一遍的核查清单。
大模型的工作方式,是根据上下文生成“最可能的下一个词”,而不是去数据库里查一个确定的答案。所以当它不知道的时候,经常不会说“不知道”,而是生成一段听起来很对的内容。这就是幻觉。
6 类高风险场景
| 场景 | 常见的幻觉 |
|---|---|
| 引用文献、论文 | 作者、标题、年份看起来都对,但文章根本不存在 |
| 法律法规 | 条款编号对不上,或者引用已经废止的规定 |
| 数字和统计 | 编出具体的百分比、金额、排名 |
| 最新信息 | 用过时的知识回答最近的事,比如价格、政策、产品版本 |
| 链接和网址 | 生成一个格式正确但打不开的 URL |
| 人物和机构 | 把两个人的经历混在一起,或者给公司安上不存在的产品 |
越是具体、越像“硬知识”的内容,越需要核查。
提问时就降低幻觉
- 给材料,让它基于材料回答:“只根据下面的文档回答,文档里没有的就说没有。”
- 允许它说不知道:“如果你不确定,请直接说不确定,不要猜。”
- 要求标出处:“每个结论标出来自原文的哪一段。”然后自己去对照。
- 拆小问题:一次问一件事,比一次问十件事准确。
- 用联网搜索功能:查新信息时开启搜索,并点开它给的来源看一眼。
- 交叉验证:同一个关键问题,换个问法再问一次,或者换一个模型问,答案不一致的地方重点核查。
交付前的核查清单
写报告、发文章、给客户发资料之前,逐条过一遍:
- □ 所有数字都能找到原始出处吗?
- □ 引用的论文、书籍,在学术数据库或出版社网站能搜到吗?
- □ 引用的法规条文,在官方数据库(如国家法律法规数据库)核对过原文和是否现行有效吗?
- □ 所有链接都点开检查过吗?
- □ 人名、机构名、产品名拼写正确吗?
- □ 涉及时间的信息,是最新的吗?
- □ 有没有模型“替你”下的结论,而你自己并不认同?
哪些事别交给 AI 做最终判断
医疗诊断、法律意见、投资决策、涉及安全的操作步骤。AI 可以帮你整理问题、查资料、准备和专业人士沟通的清单,但最后的判断要由专业人士和你自己来做。