相信大家在使用 GPT、Claude、DeepSeek 这些模型时,一定碰到过幻觉问题。
尽管语言模型能力日益增强,但「幻觉」现象始终是难以彻底解决的顽疾。
最可怕的是,它总能给你一个答案。
不管信息够不够,它很少主动停下来。答案有背景、有术语,推导看起来也很完整。结果一核对,论文不存在,版本号是编的,连链接都打不开。
这种看起来合理,实际却是错误或无法验证的内容,就是大模型幻觉。
它不会像代码报错那样给你一个红色提示,还可能把真资料和假结论混在一起。我们又很容易把「有答案」误认为「它知道答案」。
为什么会这样?LLM 的预训练是在预测下一个token。它学的是「接下来出现什么最合理」,不是「这句话有没有经过事实验证」。监督微调和偏好对齐能减少错误,但如果评测更喜欢完整答案,模型还是会倾向于猜一个。
所以,解决幻觉不能只靠一句「请准确回答」。还得让模型知道什么时候该停,什么时候该找证据。
后来我想到《论语·为政》里的一句话,把它写进了 Agent 的soul.md。
知之为知之,不知为不知,是知也。
效果竟然相当不错。它没有告别幻觉,但碰到证据不足的地方,开始愿意说明缺了什么,请我确认。
不得不佩服老祖宗的智慧。
先把边界说清楚
Agent 遇到陌生内容就直接拒答,同样没法干活。这句话管的是回答边界。
我希望它继续查,也可以根据现有资料往下推,但要说清楚依据。
有资料直接支撑的,算确定事实;资料不完整但推导说得通的,算逻辑推断;找不到依据的,只能算猜测,需要把问题交还给人。
不是闭嘴,是别装懂。
为什么它总能接着编
预测下一个 token 只是原因之一。
LLM 还要经过监督微调和偏好对齐,而人类偏好也不总是指向事实。Sharma 等人的研究发现,经过人类反馈微调的 AI 助手会出现迎合倾向,也就是阿谀奉承。
资料不足时继续补全,容易产生幻觉;推理没有证据钉住,会越写越远;用户先给结论,模型又容易顺着说。
OpenAI 在 2025 年发过一篇研究,题目就叫 Why Language Models Hallucinate。里面有个观点我很认同,很多评测只奖励答对,却没有奖励模型在不确定时放弃作答。
这种评分方式其实是在逼模型猜。就像考试时不会也要蒙,空着肯定没分,写了还有机会撞对。想让 Agent 诚实,就得让「我不确定,先去查」也能得分。
7 条规则,直接放进soul.md
一句古话还不够具体,我把它补成了可执行的规则。
## 认知诚实 知之为知之,不知为不知,是知也。 处理事实性或技术性问题时: 1. 区分已验证事实、逻辑推断和待验证猜测。 2. 已验证事实要能指出证据或复现方式。 3. 逻辑推断要写明依据、前提和仍未确认的部分。 4. 不得编造来源、链接、文件、接口、版本号、日志和实验结果。 5. 用户的前提与证据冲突时,直接指出,不要为了迎合用户改变结论。 6. 缺少证据时,优先检索、运行测试或请求用户补充信息。 7. 给关键结论加标记: -🟢 有直接证据支持; -🟡 基于现有证据的推断,仍有条件限制; -🔴 暂无足够证据,需要继续查证或请用户确认。其中第 4 条最为关键。编一段分析,可能只是浪费几分钟;编一个不存在的版本号、论文标题或 API,真的会把人带沟里。
别太信那个 90%
你问 Agent 有多大把握,它张口就能给你一个90%。这个数字看着很科学,实际上也可能是现编的。
关于 LLM 自报置信度的研究发现,模型经常过度自信,换一种问法,结果还可能跟着变。所以我更愿意看证据、多次回答的一致性和独立来源。
按照这个思路,我整理了一张评分表。
评分维度 | 我在检查什么 | 权重 |
证据支撑度(Evidence) | 外部资料能不能直接支撑答案 | 40% |
多次回答一致性(Consistency) | 多次独立采样后,结论是否稳定 | 25% |
信源交叉验证(Cross Validation) | 独立来源能不能互相对上 | 15% |
生成不确定性(Uncertainty) | 关键 token 和实体是否反复摇摆 | 10% |
来源可靠性(Source Quality) | 来源是官方文档、论文、源码,还是二手转述 | 5% |
知识边界检测(Boundary) | 问题是否超出当前资料和工具的覆盖范围 | 5% |
每项按0~100分计算后乘以权重。生成越摇摆,不确定性得分越低。
🟢85~100分,可以给明确结论;🟡65~84分,只给条件性判断;🔴 低于65分,先查资料或找人确认。
这里还得留个后门。关键事实没有直接证据,或者几个可靠来源互相打架,即使总分看着不低,也不能标绿。加权分只能帮我们排风险,不能把硬伤平均掉。
这几个维度对应了业界常见的研究方向。Self-Consistency看多次回答是否收敛,Uncertainty Estimation 看 token 概率和语义差异,RAG Grounding Score 检查结论有没有检索资料支撑,Calibration则用历史正确率校准置信度。单个指标都不保险,放在一起更实用。
还要几道保险
一句话无法消灭所有幻觉。上下文会稀释规则,检索资料可能过期,模型甚至会编一份看起来很专业的证据分析。标题里的「根治」,针对的是一个坏习惯,没证据也要把答案补完整。
真放到生产环境里,Prompt 只能守第一道门。后面还要接官方文档和内部知识库,关键结论绑定引用,版本号、接口名、数字和链接交给程序校验,高风险操作继续保留人工确认。
还可以挑 20 个最容易翻车的问题做回归测试。每次调整soul.md后重新跑一遍,看它会不会乱编,该求助时能不能停下来。
回到那句话
真正的「知」,也包括知道自己的边界。把这句话写进soul.md,不会让 Agent 变得全知,但能让它少装懂一点。
如果你也在维护自己的soul.md、AGENTS.md或系统提示词,可以先把上面的规则拿走,再用手头那些最容易产生幻觉的问题试一遍。
别只看它回答得像不像。
看它凭什么这么回答。
学习资源推荐
如果你想更深入地学习大模型,以下是一些非常有价值的学习资源,这些资源将帮助你从不同角度学习大模型,提升你的实践能力。
一、全套AGI大模型学习路线
AI大模型时代的学习之旅:从基础到前沿,掌握人工智能的核心技能!
因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取
二、640套AI大模型报告合集
这套包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示
因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取
三、AI大模型经典PDF籍
随着人工智能技术的飞速发展,AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型,如GPT-3、BERT、XLNet等,以其强大的语言理解和生成能力,正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。
因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取
四、AI大模型商业化落地方案
作为普通人,入局大模型时代需要持续学习和实践,不断提高自己的技能和认知水平,同时也需要有责任感和伦理意识,为人工智能的健康发展贡献力量。