a tall building lit up at night

微软亚洲研究院

破解AI幻觉黑盒:大模型如何判断自己说的是真是假?

公開済み

当你向AI模型询问“法国大革命期间,路易十六被处决的具体日期是哪一天”,它能迅速给出“1793年1月21日”的标准答案。可当你追问某个冷门的地方戏曲流派起源时,它却可能面不改色地编造出一个听起来头头是道的虚假地名。这种一本正经地胡说八道的现象,就是大模型的幻觉。

这种幻觉不像代码报错那样直接崩溃,而是以极高的可信度输出错误信息。在闲聊场景中,这或许只是茶余饭后的笑料,但在医疗、法律或金融等关键领域,AI幻觉轻则误导决策,重则引发重大风险。

那么如何让AI学会“知之为知之,不知为不知”?这不仅是工程上的难题,更是人工智能迈向可信时代必须攻克的关卡。

AI幻觉检测难:内在判别信号来源是未解之谜

为了减少AI幻觉,目前业内主要采用两类方法来识别错误答案。

一是借助外部世界审查。例如,当AI回答完一个问题后,再利用搜索引擎、知识库,或者让另一个大模型进行事实验证,对照真实信息判断答案是否正确。这种方法虽然准确率较高,但需要访问外部资源,既增加了计算成本,也会带来额外的时间开销。更重要的是,它只能告诉我们答案错了,却无法解释AI为什么会犯错。

另一种方法更具前瞻性。科学家发现,在AI生成答案的过程中,其内部的神经元激活状态其实暗含着“我在撒谎”或“我很确定”的信号。通过训练一个十分简单的线性分类器,仅凭这些内部表示,就能提前识别AI是否即将产生幻觉,而无需访问任何外部知识。然而,一个关键问题始终没有解决:这些真实性信号究竟从哪里来?这种黑盒状态使得科研人员难以从根本上提升模型检测的准确率。

针对此问题,微软亚洲研究院的研究员们发现,AI的真假判断并非来自单一机制,而是源于两条完全独立、互不干扰的信息通路。进而,他们提出了两种全新的检测方法,为构建更加可靠、更加可信的大语言模型提供了全新的思路。相关论文已被ACL 2026接收。

论文信息已整理至文末,欢迎点击相关链接,了解更多技术详情。

揭秘AI的双重判别系统

为了真正了解AI内部发生了什么,研究员们设计了一系列实验,来分析模型内部信息在不同模块之间流动的过程,并人为切断或修改其中某些信息,再观察真假判断能力。实验结果显示:AI内部存在两套彼此独立的真假判别系统。

第一套系统是提问对照模式。这种模式下,AI会不断回看用户最初提出的问题,把问题中的核心关键词与自己正在生成的答案进行持续核对。例如,当询问“南卡罗来纳州的首府是什么”时,模型会一直围绕南卡罗来纳州和首府这两个关键信息进行推理。如果人为切断问题与答案之间的信息流,模型判断真假的能力便会下降。研究员们进一步实验发现,只要修改问题中的关键实体,AI原本稳定的真假判断也会随之改变。这说明,在这一模式下,AI高度依赖问题提供的信息。

question and answer
图1:精确问答标记示例。颜色表示标记类型:红色代表精确属性标记、蓝色代表精确主语标记、绿色代表精确答案标记。

第二套系统是自我校验模式。这套系统完全不看问题,直接从自己生成的答案中提取自洽的证据,例如用词的逻辑性、句子的连贯度、内部事实的一致性。即使把问题整个删掉,只给AI一段它自己写的文字,这套机制仍然能够继续工作。

这两套系统并非随机出现,而会根据知识类型自动切换。对于世界首都、著名人物、经典历史事件等模型熟知的知识,AI会采用提问对照模式,因为这些知识已经十分熟悉,只需快速核对问题即可完成判断。面对冷门人物、生僻地点、长尾知识时,模型则更容易启动自我校验模式,更多依赖生成内容本身进行一致性检查。

diagram
图2:关键问题-答案信息流显著性评分分布的核密度估计图。双峰模式表明存在两种不同的信息传递机制。

进一步研究还发现,AI不仅能够自动切换两种机制,它甚至知道自己当前正在采用哪种机制通过分析模型内部表示,研究员们能够更准确地预测模型此刻采用的是哪一条判断模式。这意味着,大语言模型在拥有真假判断能力的同时,还能够识别自己正在以何种方式进行判断。这一发现,为理解AI内部运行机制打开了一扇新窗,让人们可以看到AI辨别真假背后的工作方式,而不仅仅是观察它最终给出的答案。

两种全新的检测方法,精准找出AI幻觉

在此之前,业界所有基于模型内部信号的幻觉检测工具都采用统一判定框架,用同一个分类器处理所有问答样本,并未察觉AI两套判别系统的本质差异,检测精度始终存在上限。因此,研究员们基于前文提到的发现,设计了两套全新的检测工具,大幅提升了检测精度。

第一种检测方法是混合多检测器(Mixture of Probes,MoP)。其核心思想是“专业的事交给专业的人”。研究员们不再训练单一的分类器,而是针对提问对照模式和自我校验模式分别训练两个专用的线性分类器。一个分类器专精于捕捉问题-答案之间的语义对齐信号,另一个专注于挖掘答案文本内部的逻辑自洽信号。

随后,利用模型本身的自我认知能力,动态决定这两个分类器在最终判别中各占多少权重。如果模型正在处理常识性问题,提问对照模式就具备更高的话语权;反之,在处理冷门知识时,则更信赖自我校验模式。这种分而治之的策略,极大地发挥了每种信号的特长,使得检测精度相较于传统单模式方法有更好的提升。

第二种方法是注意力权重调节器(Pathway Reweighting,PR)。如果说MoP是在增加不同类型的专家,那么PR更像是一种神经调节术。它不需要额外的分类器,而是直接在模型的推理过程中,通过调整注意力机制中的权重系数,来放大或缩小特定信息流的强度。具体来说,当模型处理常识性知识时,PR模块会增强答案token对问题token的注意力,确保模型不会忘记题目;当模型处理长尾样本时,PR模块则会抑制这种跨距离的依赖,防止模型因为强行关联不相关的冷门问题而产生错误联想。这种微调是轻量级的,无需重新训练庞大的基础模型。

研究员们在12款不同规模、不同架构的大语言模型,以及4个具有代表性的开放问答数据集上进行了全面验证。结果显示,无论是采用混合多检测器方法,还是注意力权重调节器,都能稳定提升幻觉检测效果另外,这种提升在不同规模模型、不同类型模型之间都表现出了良好的泛化能力。

更值得注意的是,这两种方法都建立在对AI内部机制的理解之上,不是简单堆叠更多数据或更复杂的算法。这意味着,它们不仅提升了性能,更重要的是让幻觉检测开始从经验驱动走向机制驱动。科研人员也将能够真正理解模型为什么会产生这些信号,并据此设计出更加符合AI内部工作规律的检测方法。

看懂AI内在机制,推动可解释AI的发展

长期以来,人们总是把大语言模型看作一个难以解释的“黑盒”。此次研究系统性地解构了大模型内部真实的表征机制,证明了大模型并非简单的统计概率生成器,在其深层网络中确实存在着结构化、可解释的元认知信号。这有利于推动人们对大模型黑盒机理的理解,为构建真正透明的AI系统奠定基础。

与此同时,研究员们提出的方法主要利用模型内部已经存在的计算信息,无需重新训练大模型,也无需依赖外部知识,就能够识别潜在的幻觉风险,因此更加轻量、高效,具备适配主流大语言模型的潜力,为医疗、金融、政务等对事实准确性要求较高的场景提供了新的可能。

更重要的是,这项研究为AI幻觉治理指出了新方向。未来,AI或许不仅能够在回答之后接受事实核查,更能够在生成过程中主动意识到自己的不确定性,及时自我纠错,甚至坦率地告诉用户“我不知道”。从理解AI如何辨别真假,到帮助AI学会在不确定时保持谨慎,将有助于构建更加诚实、可靠、可信的人工智能。

Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations

论文链接:https://arxiv.org/abs/2601.07422 (opens in new tab)