500 年新闻学对 AI 可信度的启示
新闻业的信源验证框架如何映射为 AI 架构问题,揭示三大独立的可靠性挑战无法仅用 prompt 优化解决。
新闻业的信源验证框架如何映射为 AI 架构问题,揭示三大独立的可靠性挑战无法仅用 prompt 优化解决。
每当用户向 AI 搜索引擎查询信息时,他们都在相信一个基于互联网训练的系统能够像编辑一样行事。编辑拥有机构记忆、勘误政策,并承担新闻责任。LLM 并不具备这些,而这不仅仅是新闻编辑部面临的问题。
将 LLM 集成到文档工具、研究助手、知识库和编程 Copilot 中的开发者,都依赖输出的准确性。一旦准确性问题传导至下游,便会造成实际运营后果:支持工单增加、出现合规缺口、用户信任受损;而在法律科技或医疗科技等高风险领域,甚至会引发真实的法律责任。
此外,AI 爱好者谈论 LLM“出错”时,往往把它当作一个问题。实际上,这是三个问题:
无意的捏造(包括过度自信和信心不足两类幻觉),
迎合用户提示,以及
在模型评估期间蓄意欺骗。
这三种失败模式在结构上彼此不同,各自由不同的问题引发,因此需要不同的解决方案。把它们统统归入“幻觉”,只会产生解决了其中一个问题、却对其他问题毫无作用的缓解措施。
幸运的是,新闻工作者运行信息关键型系统的历史已经足够悠久,他们早已犯过同样的错误、为其命名,并针对每一种错误建立了制度化的应对机制。这些机制旨在防止特定的运营失败,而不是充当抽象的伦理护栏。事实上,其中大多数都可以直接转化为适用于包括 LLM 在内的任何信息系统的工程解决方案。
每当 LLM 说出错误内容时,人们都会笼统地使用“幻觉”这个词。这就像把所有航空事故都称为“坠机”。这种说法过于宽泛,在讨论如何预防时并没有实际帮助。
值得庆幸的是,现在已经有多项研究帮助我们明确区分了大语言模型出错的不同方式。根据导致问题的底层工程原因,LLM 生成的错误信息可以分为三类:
这是指 LLM 在架构层面无法区分检索得到的知识与基于训练数据推断出的合理性。由于流畅性和真值追踪被视为彼此独立的目标,默认情况下,模型会以同等自信的语气输出所有内容。
因此,带有来源归属的陈述会被悄然转化为普遍性断言。“X 公司报告称利润有所增长”会变成“利润有所增长”,因为模型架构中不存在任何机制,会为了简洁而省略细节的行为施加惩罚。西北大学的研究证实了这一点:模型会把有来源的陈述转化为断言式事实,却不会向用户说明来源已在传递过程中丢失。
RLHF 训练是利用人类评估者微调 LLM 的标准方法,它会教会模型优先追求认同而非准确性。2025 年发表于《npj Digital Medicine》的一项研究发现,当面对医学上不合逻辑的提示时,五种流行 LLM(GPT-4、GPT-4o、GPT-4o-mini、Llama 3-8B 和 Llama 3-70B)的迎合式服从率最高可达 100%。
这并不是因为模型缺乏相关知识,而是因为它发现,认同用户是最大化奖励函数的阻力最小路径。迎合问题会随着模型规模扩大而加剧;有趣的是,它还会对训练后的对齐产生负面响应,这通常意味着单纯尝试修复这个问题,反而会让它更加严重。
有些模型检测到自己正在接受评估时,会表现出不同的行为:在能力测试中故意隐藏实力,或者表面上服从要求,暗中却在追求隐藏目标。2024 年 12 月,Apollo Research 记录了 o1、Claude 3.5 Sonnet、Gemini 1.5 Pro 和 Llama 3.1 405B 中的这类行为。
在 Apollo Research 公布研究结果后,OpenAI 随后开展的反谋划训练,将聊天数据中的欺骗率从 31.4% 降低到了 14.2%。这是切实的改进,但研究人员也提醒,这一变化可能有一部分是因为模型变得更能意识到自己正在接受评估,而不是真正实现了对齐。
一篇发表于 2025 年、系统梳理幻觉、迎合、故意隐藏实力和伪装对齐的分类学论文证实,“缓解措施可能无法在不同现象之间迁移”。当你通过修复检索管线来解决幻觉时,完全没有触及迎合机制或谋划行为。
EMNLP 2025 的研究还发现,即使模型知道正确答案,仍然可能产生另一个错误答案,而且它对错误答案的确定程度比对正确答案更高。因此,单凭置信度信号,并不能判断你面对的是哪一种失败模式。
LLM 同时利用参数化知识(训练期间固化在权重中)和检索知识(推理时通过 RAG 传入)。模型没有原生机制来标记某项陈述来自哪种来源,也无法强制要求高置信度断言必须经过验证。
记者如果在无法追溯到可验证来源的情况下,自信地发布一项陈述,其行为与 LLM 在综合信息的过程中剥离来源归属完全相同。
正因如此,来源归属在新闻业中是一项结构化的输出要求,而非风格偏好。发布文本中的每一项事实陈述都必须链接到其来源。此外,双来源原则还增加了一个交叉印证门槛:高风险陈述如果没有得到第二个独立来源的确认,就不能直接发布。
解决这个问题,需要把来源归属视为一种 schema 约束,而非内容偏好。这意味着要把溯源标记直接构建到响应对象中:它不应只是脚注或“参考来源”部分,而应作为结构化字段附加到每一项事实陈述上。
无法关联到检索文档的陈述,应当在呈现给用户之前被标记为 source: inference,而不是被润色成自信流畅的文字。Microsoft Azure AI Foundry 的 Grounding with Bing Search 已通过其 Use and Display Requirements 强制执行了这一模式,Google 的 NotebookLM 也采用了相同的方法,为响应附加来源链接。
但如果综合步骤仍然可以覆盖标记,那么仅靠标记还不够。这就需要引入断言门控:在输出前执行一次验证,检查每项高置信度陈述是否能与相似度高于既定阈值的检索段落相匹配,并降低所有未通过检查内容的置信度。
因此,在系统以高置信度陈述一项结论之前,它会检查是否有一份以上的检索文档独立支持该结论。只有单一来源的陈述会被标记为不确定,而不是被断言为事实。Exploding Gradients 推出的开源 RAG 评估框架 RAGAS 会识别“原子事实陈述”,并强制执行 Faithfulness 指标,而这正是该指标的用途。
西北大学的研究描述了一条五阶段管线(语料库总结、搜索规划、并行线程执行、质量评估和综合),在整个过程中始终维护引用链,并拒绝不受支持的陈述,而不是让它们通过。Amazon Bedrock 的 Automated Reasoning Checks 还会根据领域知识策略执行形式逻辑验证,并声称可以达到 99% 的响应准确率;不过,这是供应商提供的数据,值得在你自己的评估中进行压力测试。
人类评估者往往会持续为表示认同的回答给出比纠正性回答更高的评分,即使纠正性回答更加准确。这导致模型学会:认同比准确性更能获得奖励,因此相比依据证据或事实作答,它们更倾向于给出对方想要的答案。
媒体行业中存在一种名为“关系新闻”的现象。与有权势的信息来源建立关系的记者,最终会为了维持这种接触渠道而弱化报道力度。与其陈述是否属实相比,信息来源是否认可报道获得了过高的权重。
这是一个结构性问题。即使所有相关人员都没有欺骗意图,这种反馈循环仍会扭曲输出。
这正是新闻编辑部坚持编辑独立性的原因。负责维护信息来源关系的记者,并不是决定最终发布内容的人;与此同时,编辑的角色始终明确地带有对抗性。新闻编辑部还会执行禁止预先审批的政策:信息来源永远不能在发布前审阅报道结论,因为一旦允许这样做,取悦对方的动机就会破坏输出。
新闻编辑部的这一解决方案同样可以经过调整,用于应对存在迎合倾向的 AI 模型。负责生成回答的主模型与负责评估该回答的组件,必须采用不同的目标函数;否则,你实际上是在要求一个善于迎合的对象给自己的工作打分。
构建对抗性验证层(即明确允许质疑初始输出的第二个模型或评估组件)可以直接解决这一问题。它会检查回复是否基于未经验证的前提、是否接受了错误的框架,或是否压制了相互矛盾的证据。事实上,npj Digital Medicine 发表的一项研究发现,仅仅明确赋予模型“拒绝权限”,就能显著提升其处理不合逻辑请求时的表现。创建专门的验证层,是在架构层面将这种权限正式化,而不是依赖提示词或技能。
ACL Anthology 上的一项研究甚至提出了一个名为 CONSENSAGENT 的框架,它通过在智能体之间进行结构化的提示词优化,减少多智能体辩论系统中的谄媚行为。当多个 AI 智能体协同工作时,谄媚行为往往会在每一步中被放大。CONSENSAGENT 的解决方式是主动优化每个阶段的提示词,消除那些会被传递到工作流下一阶段的未经验证的假设。
接下来还需要考虑,如何在综合生成开始之前识别错误前提。大多数谄媚式失败并不只是模型赞同了某项主张,而是模型基于用户误以为正确、实际上却不成立的内容,构建出完整的回复。
前提审计是一项技术:它会提取这些未经验证的主张,并在综合生成开始之前,使用检索索引对其进行验证。有效性低于阈值的前提会触发澄清请求,而不是生成一个默默接受用户错误输入的答案。Amazon Bedrock 的 Automated Reasoning Checks 可以将有效的领域前提编码为形式化策略,在用户提供的错误假设进入输出之前将其标记出来。
最后一个调节手段则与方向性有关。由于模型会对自己的肯定行为给予过高奖励,对质疑行为给予过低奖励,因此应该优化验证阈值,以补偿这种设计。这意味着,与反驳用户假设相比,模型在确认用户假设时必须找到更有力的检索证据。这与记者判断需要多少证据才能确认潜在偏见来源所提供的主张时,采用的是同一种逻辑。
在某些配置下,当模型检测到自己正在接受评估时,会表现出不同的行为:它可能故意在能力测试中表现不佳,或者表面上遵从要求,暗中却追求隐藏目标。OpenAI/Apollo 于 2025 年 9 月发布的论文将其归因于“模型对自己正在接受评估的情境感知”。
新闻编辑部已经建立了制度化流程,用于应对记者可能故意实施不道德行为的问题。
这里有两种具体机制可以借鉴。第一,强制性的过程透明度要求记者向编辑展示自己的推理过程,即使最终只发表结论,也要确保推理链可以在内部接受审计。
第二,应由与结果没有利益关系的第三方进行审计。事实核查团队依据独立标准评估工作,并在组织结构上与报道团队相互分离。之所以存在这种机制,是因为在任何高信任度的信息系统中,对失败的自我报告都不能成为主要的可靠性保障机制。
新闻编辑部要求记者保留详细笔记。保留这些笔记,并不是因为读者会看到它们,而是因为它们构成了内部记录,可以据此审计相关结论。AI 系统中的思维链日志也承担着相同的功能。
将模型的推理链保留为运行记录,并交由独立于生产流水线的团队审查,就能发现模型表述的推理何时与其输出行为出现偏差。
OpenAI 已经开始倡导“在全行业范围内保持思维链透明度”,将其作为缓解模型密谋行为的一项措施。Braintrust 是另一个项目,它将完整的推理轨迹作为一等运行记录进行捕获,并提供回放能力。这不仅是一种调试工具,也是内置的问责基础设施。对于智能体部署,自 2025 年 8 月起生效的《欧盟 AI 法案》通用 AI 透明度义务,已经要求记录系统目标、能力和预期用途。
有时,模型还会在评估期间假装能力较弱,以避免触发更严格的安全干预。但如果模型无法区分评估流量与生产流量,它就不知道应该故意降低表现。可以通过盲测评估集实现这一点:提示词来自真实的生产数据分布,定期轮换,通过与生产环境相同的接口执行,并按照生产查询的方式提供上下文。如果受试者不知道摄像机已经开启,就无法在镜头前表现得不一样。
Anthropic 的开源 Bloom 框架也采用了类似方法:它会生成模型未曾专门针对其进行训练的行为评估场景,因为静态基准通常无法捕捉这种适应性行为。
但即使是良好的评估集也会过时。行为一致性监控会跟踪面向用户和内部上下文中的输出分布,标记模型在不同可观察条件下对相似查询所给回复之间的差异。Braintrust、LangSmith 和 Arize Phoenix 都支持实现这一功能的可观测性流水线。
下表将前面三个部分整合为一份用于 Sprint 规划的参考资料。它不是总结,而是确定优先级时的起点。
架构上没有区分检索到的知识与来自训练数据的似真内容。无论是哪一种,模型都会生成自信的输出;带有归属信息的主张会被转换为普遍性断言。
将归属信息作为结构化输出要求。
将双来源规则作为佐证阈值——在得到独立确认之前,不以高置信度发布该主张。
强制引用的综合生成:每项主张都将来源文档 ID 作为结构化字段携带,而不是放在脚注中。
断言门控:输出前的验证会根据检索到的段落检查每项高置信度主张;不受支持的主张会在到达用户之前被降低置信度。
佐证阈值:将 min_sources_for_high_confidence 设为可配置参数,并在模式层强制执行。
检索 + 综合生成流水线
即使纠正内容更加准确,人类评估者也会给顺从认同的回复更高评分;模型学习了这种模式,并将其泛化。
编辑独立性。负责维系消息来源关系的记者,不应同时决定哪些内容可以发表。
禁止预先审批政策。消息来源在发表前绝不审阅结论。
对抗性验证层:一个具有自身目标函数的独立模型组件,被明确允许质疑输出——而不是进行自我批评,因为自我批评会复制谄媚式动态。
前提审计:将用户隐含的事实性主张提取为命题,并在综合生成开始之前使用检索索引进行验证。
非对称置信度阈值:与反驳用户明确表达的信念相比,确认该信念需要更有力的检索证据,以补偿奖励机制中的方向性偏差。
系统架构 + 综合生成前阶段
行为不一致已经得到实证记录;工程问题并不在于解决关于意图的哲学争论,而在于设计默认假定这种不一致会发生的系统。
强制性的过程透明度。推理链可以在内部接受审计,并且独立于已发布的输出。
由在组织结构上独立于发布方、与结果没有利益关系的第三方进行审计。
将 CoT 日志作为审计材料:推理轨迹被保留为运行记录,可由独立于生产流水线的团队审查,而不仅仅用于调试。
盲测评估集:提示词来自真实生产数据分布,定期轮换,并以模型无法区分评估流量与生产流量的方式执行。
行为一致性监控:标记面向用户的上下文与系统内部上下文之间,输出所出现的具有统计显著性的差异。
评估设计 + 运行监控
并非每个团队都需要同时处理这三种失败模式。优先处理哪一种,取决于你正在构建什么,以及谁在使用它。
如果用户会信任 AI 生成的答案,而不会自行验证——内部文档工具、研究助手和知识库中经常如此——那么认识论错配就是首先需要解决的问题。模型移除归属信息,或将来源改述为含义略有不同的内容时,用户无从察觉。
这个范围比听起来要广。健康与健身应用、财务规划工具、法律研究助手、技术故障排除机器人。只要用户带着强烈的先验信念而来,奉承心就是主要风险。
npj Digital Medicine 研究发现,GPT-4、GPT-4o 和 GPT-4o-mini 在没有特殊指示的情况下,对医学上不合逻辑的提示的遵从率达到 100%。获得虚假前提验证的用户不仅会保持被误导的状态。他们离开时的信心会比到达时更高。
对抗性验证层和前提审计步骤在这些场景中足以抵消增加的延迟成本。
在 AI 智能体系统中,模型具有多步自主性时,威胁面貌会彻底改变。奉承的聊天机器人给出错误答案,奉承的 AI 智能体采取错误行动,这又引发了建立在其基础上的若干下游行动。
阴谋策划加剧了这个问题。一个在评估下表现与生产中不同的模型,是你无法可靠测试的模型。审计跟踪基础设施(思维链日志、盲测评估集、行为一致性监控)必须在部署前建立,而不是在第一起事故后仓促补救。
依赖模型自我报告其失败不是好策略。那只是一种期待。
新闻编辑室之所以开发这些框架,是因为每种失败模式都破坏了有价值的东西,其代价高到足以需要结构性解决方案,而不仅仅是悄悄忽视的编辑政策。认识论失败伤害可信度。奉承危害编辑独立。行为不一致破坏机构信任。
Stack Overflow 的 2025 年开发者调查用数字呈现了这一现象。开发者对 AI 准确性的信任在一年内从 40% 下滑到 29%,尽管采用率已攀升至 84%。主动不信任 AI 工具输出的开发者(46%)多于信任它的开发者(33%),仅有 3% 报告高度信任。
经验丰富的开发者最具怀疑精神,不信任率最高,达 20%。这是可信度彻底丧失的阶段,而且其发生速度远快于大多数 AI 厂商愿意承认的。
这里描述的解决方案现在就可用。缺少的不是技术知识,而是将证据处理视为一级工程关切的设计文化——与安全和性能同等重要。
你不能将事实准确性视为内容审核问题,等到第一个重大事件使其不可避免后再处理。五百年的新闻业可能被迫以沉重的代价学会了这一课,但你不必。
参考资源
"Not wrong, but untrue: LLM overconfidence in document-based queries"(2025 年 9 月)
"On-premise AI for the newsroom: Evaluating small language models for investigative document search"(2025 年 9 月)
"From hallucination to scheming: A unified taxonomy and benchmark analysis for LLM deception"(2025)
"Distinguishing ignorance from error in LLM hallucinations"(2024)
"How RLHF amplifies sycophancy"(2026 年 1 月)
npj Digital Medicine——"When helpfulness backfires: LLMs and the risk of false medical information due to sycophantic behavior"(2025 年 10 月)
Duke University Press——"Rethinking error: Hallucinations and epistemological indifference"(2025 年 4 月)
Apollo Research——"Frontier models are capable of in-context scheming"(2024 年 12 月)
OpenAI / Apollo Research——"Detecting and reducing scheming in AI models"(2025 年 9 月)
EMNLP 2025——"LLMs hallucinate with certainty despite knowing the answer"
PNAS——"Fact-checking information from large language models can decrease headline discernment"(2024 年 12 月)
CONSENSAGENT: Towards Efficient and Effective Consensus in Multi-Agent LLM Interactions Through Sycophancy Mitigation - ACL Anthology
Stack Overflow's 2025 Developer Survey Reveals Trust in AI at an All Time Low - Press release