
人工智能系统常以绝对的笃定感输出答案,陈述事实时不带限定词,推荐策略时仿佛所有变量均已完美就位。商业领导者据此行动,却往往发现决策基础远比表面薄弱。
随着大型语言模型(LLM)深入嵌入决策循环、客户服务及自主代理,这一风险日益加剧。当信息缺失时,模型并非通过表达“不确定”来规避风险,而是生成流畅但实质经不起推敲的文字,营造出极具权威性的假象。
媒体指出,管理者不应止步于答案本身,而应深究建议的来源、假设及置信度。若缺乏追问,AI可能引导组织基于推断而非证据做出选择。
训练机制催生“确定性幻觉”
这种现象根植于训练目标。模型被奖励预测最可能的下一个词元,而在基准测试中,承认无知不得分。OpenAI研究人员在近期论文中指出,标准评估流程给猜测更高分数,即使回答错误也可能获部分分,拒绝回答则得零分。长此以往,系统学会即使在底层概率接近随机猜测时,也表现得确定无疑。
随之而来的是“幻觉”问题。模型捏造引用、编造数据并自信陈述错误事实。一项针对250万篇论文中1.11亿条科学参考文献的审计显示,随着大语言模型广泛采用,不存在引用数量急剧上升。数据显示,仅在2025年,保守估计就有近14.7万条幻觉引用产生,主要集中在AI密集领域及小型研究团队中。
高风险场景下的自信误差
问题不仅限于学术写作。在临床环境中,模型在信息缺失时反而更加过度自信。一项考察LLM在不确定性增加情况下对500个医学问题回答的研究显示,准确率下降但声明置信度依然很高,不安全且自信的误差激增。根据2026年8月发布于arXiv的研究,GPT-5、LLaMA和Mistral等模型在关键细节缺失时,产生高置信度错误答案的比例介于76%至81%之间。
Google DeepMind从另一角度探讨此问题。研究人员测试多款主流模型后发现,回避行为源于内部置信度信号与简单阈值规则的结合。研究表明,回避行为由多维内部置信度表示与基于阈值的策略之间的相互作用所捕捉。
自主代理进一步加剧了风险。无法识别自身不确定性的代理仍会采取行动,可能查询错误数据库、合成缺陷代码或基于错误假设升级客户投诉。早期编码代理实验已显示螺旋式故障模式:分析显示,在崩溃前,模型曾生成多达693行的幻觉代码,在初始错误之上构建推理且从未恢复。
人类认知偏差与技术局限
人类用户加剧了这一困境。人们倾向于将流畅、自信的语言视为能力信号。《国际人机交互杂志》今年2月在线发表并于本月更新数据的一篇新论文,将前景理论应用于该问题。研究发现,参与者低估高精度AI,而高估低精度系统,即使显示的准确性数字经过良好校准,这种效应依然存在,导致依赖决策偏离实际表现。
模型内部的两种竞争偏见解释了这一悖论:“选择支持性偏见”放大模型对首个答案的置信度,使其抵抗相反证据;同时,系统对矛盾信息的权重超过支持信息,偏离贝叶斯更新。DeepMind、伦敦大学学院等机构研究人员今年早些时候在《自然·机器智能》上记录了这些机制在事实和推理任务中的作用。
校准工作结果混合。一些团队通过断言级别验证后使用各向同性回归取得成功,将预期校准误差从0.212降至0.038,同时保持约76%的准确率。然而,即使改进后的系统,在70%以上的置信度阈值下仍会产生过度自信误差,口头表达的置信度与实际可靠性之间的差距依然顽固。
麻省理工学院(MIT)研究人员今年春天提出不同路径:不依赖模型内部概率分数,而是通过比较一组相似模型的输出来测量认识论不确定性。群体间的分歧比自我报告的置信度更可靠地标记潜在幻觉。该方法在2026年3月的EurekAlert摘要中详述,可为用户提供实用信号,无需更改底层模型。
企业应对与未来展望
基准测试描绘了严峻画面。截至2026年9月17日更新的Artificial Analysis Omniscience Hallucination Rate排行榜显示,即使是顶级模型,在知识密集型任务中也有14%到20%的时间产生幻觉。Cohere的Command A+目前以14.2%的比率领先。较小专用模型有时优于更大模型,表明单纯扩大规模无法解决不确定性问题。
企业部署已开始适应。一些组织强制模型引用来源并标记低置信度声明;其他组织将模糊查询路由给人工审核员或检索增强系统,以确保答案基于已验证数据。少数尝试使用明确的不确定性语言,有研究人员指出:“当模型不知道时,它应该说它不知道。”
然而,提示模型保持谦逊存在局限。虽然可以指示模型规避,但其底层表示通常仍倾向于流畅补全而非准确回避。根据9月16日发布在arXiv上的最新工作,轨迹无关的置信度在许多视觉-语言系统中持续存在。模型可能走过有缺陷的推理过程,口头自我纠正,得出错误结论,然后仍然对最终输出赋予高置信度。
决策者应将每一个自信的说法视为假设,要求提供推理链条,询问考虑过的反面证据,探查缺失数据及填补方式。当AI代理提议采取行动时,要求其量化不确定性,并定义升级给人的条件。
技术将会进步,新的训练方法可能更有效奖励校准后的回避行为,更好架构可将知识与生成分离。但就目前而言,AI听起来有多确定与其实际可靠性之间存在巨大差距。最近的论文表明,解决方案可能不在于让模型变得完全确定,而在于设计能够清晰传达不确定性并在证据支持时才采取行动的系统。在此之前,健康的怀疑态度是最好的防御。