问题:数字正确,却放进了错误的句子
助手声称某运行模式使机器年度能耗降低15%,并链接技术报告。报告中确实有“15%”,但它指的是三十天观察期内停机时间的减少。引用存在,文档讨论的是正确机器,数字也抄对了,但结论仍缺乏支持,因为测量对象和时间范围都变了。
如何区分有文档依据的回答,与仅用来源装饰的回答?本文构造四份文档组成的合成档案,并比较三种回答。把检索、陈述支持和完整性分开,可以发现单一百分比掩盖的错误。这里不评测商业产品;文档、回答和标注均为教学构造,目的是使推理可核查。
三个互不保证的步骤
RAG即检索增强生成,先选择文档片段,再提供给生成器。代理可以再次搜索、打开完整文档或提出更精确的问题,但这种灵活性不会消除“找到来源”与“正确使用来源”的区别。与问题相似的文本,可能已经过时、讨论另一型号,或只支持生成句子的一半。
相关性是来源与主题之间的关系,支持性是来源与某个具体陈述之间的逻辑关系。报告与Eco模式相关,并不能证明年度节能。完整性则指回答是否包含所需信息。一句完全有支持的回答,也可能遗漏读者所问的大部分内容。这三种问题需要不同检查。
测试档案:小到可以逐项检查
读者问题是:“当前版本P7的连续运行温度上限是多少?Eco试点记录了什么?每年能节省多少能源?”P7为虚构机器。D1是现行v3手册,给出连续运行上限80 °C;D2是过时v2手册,曾给出100 °C。D3是Eco报告,记录30天观察和15%停机时间下降,没有年度能耗估计,也没有声明样本量。D4是目录,只提到Eco,没有量化性能。
这四段文本是练习的全部信息。D3故意不完整,无法据此估计因果收益或推广到其他机器。本文研究回答是否忠实转述原文,而不是虚构报告是否证明了工业效果。不存在能够支持15%节能或一千台样本的隐藏来源。
第一项检查:是否检索到已有证据?
设人工指定检索排序为D2、D4、D1、D3。这不是实际运行搜索引擎的输出,而是用于单独说明计数。所需事实的有效文档为D1和D3。定义前k项文档召回率为这两份文档中出现在前k结果的比例。k=2时虽有两篇同主题文本,召回率却为零;k=3时为1/2,k=4时为2/2。词汇相关并不足以找到正确证据。
分母已知,是因为我们构造并检查了整个档案。真实语料中,找全所有含证据来源本身就是评估工作。此外,两份文档不等于两个事实:D1支持温度上限,D3支持时长和观测指标。k=3时检索到一半有效文档,却只覆盖三个可记录所需事实中的一个。因此,文档计数并不自动等于信息覆盖。
第二项检查:来源是否支持这个具体陈述?
考虑回答A:“连续运行上限为80 °C [D1]。Eco使年度能耗降低15% [D3]。试点已在一千台机器上验证 [D4]。”三句都有引用,文档均可打开,但仅第一句得到支持。D3讨论停机而非能量,D4没有样本量。缺乏支持并不等于必然为假:现实中可能存在节能,但本回答没有提供其证据。
把回答拆成可单独核查的原子陈述。对陈述c_i及其引用集C_i,若来源在适用上下文中完全支持该陈述,定义S(C_i,c_i)=1,否则为零;缺少引用也计零。本档案的支持关系是明确标注的,程序不理解自然语言,也不会自行发现支持关系。
n是回答陈述数量,不是检索文档数量。引用存在率为3/3,即100%,支持率却为1/3,约33.3%。若四份文档都已检索到,R_doc也为100%。因此,看似成功的检索和齐全的引用可以同时伴随薄弱的证据支持;无需虚构某模型的幻觉率即可展示该问题。
第三项检查:删掉困难陈述就够了吗?
回答B只说:“连续运行上限为80 °C [D1]。”支持率为1/1,即100%。它避免了无依据补充,却没有说明试点时长和观测指标。为衡量遗漏,在生成前定义所需且有文档依据的事实集G:80 °C上限、30天时长、报告中的15%停机减少。覆盖率U表示G中被有依据地回答的比例,不能为了迎合系统说了什么而事后修改G。
回答C保留温度上限,并说明三十天观察和停机减少,分别引用D1、D3、D3,再明确档案没有年度节能估计。三个正面事实的支持率与覆盖率均为100%。对能量问题拒绝推断,是明确说明证据边界,而不是编造第四个性能数字。这里的覆盖率仅针对三个已有事实,并不意味着问题每部分都能得到量化答案。
| 回答 | 引用存在率 | 支持率S | 覆盖率U |
|---|---|---|---|
| A | 100% | 33.3% | 33.3% |
| B | 100% | 100% | 33.3% |
| C | 100% | 100% | 100% |
两行一组比较:A与B的有效覆盖相同,但B避免两项无依据陈述;B与C支持率相同,但C提供三倍所需事实。空回答不能获得100%支持率:n=0时比值未定义,应记录为拒答,同时覆盖为零。必须预先固定这些规则,否则分数可能提高,服务却变差。

粒度与多来源引用会改变检查方式
“上限为80 °C,Eco节能15% [D1,D3]”包含两项陈述。整体评判可能隐藏失败的是哪半句,拆分则有助于精准反馈。但不能把孤立词语当成独立事实:主体、版本、数值、单位和条件应保持关联。15%与停机之间的关系,恰是错误切分可能丢掉的信息。
多来源情况下,有些陈述需要联合证据:一个文档定义代码,另一个使用该代码报告结果,只有身份与上下文一致时才能连接。不能每有一个链接就加分;要区分必要、冗余和无关引用,在单片段不足时检查整个引用集。本练习故意每项陈述只用一个来源,没有实现更一般的联合证据问题。
从ALCE借鉴什么
Gao、Yen、Yu与Chen发表于EMNLP 2023的Enabling Large Language Models to Generate Text with Citations提出ALCE,并区分正确性与引用质量。第3.3、5节描述指标、评判器与实验,以自然语言推断模型NLI估计支持关系。测试使用ASQA等数据集、当时的模型版本和明确片段预算。这是历史方法参考,不是2026年排名,也不是本档案测量结果。
本计数是明确声明的教学简化,不是完整复现ALCE。没有运行NLI、神经检索或模型生成,只声明支持关系并计算指标。真实自动验证器可能在否定、数字、版本或跨片段证据上出错。原作者的人类评估属于其研究;本文没有进行读者测试或人工标注员审核。
从指标到代理的下一步行动
这种区分还能指出改进位置。若未检索到D3,仅要求生成器更精确,不会凭空提供缺失证据,需要改进搜索、筛选或访问。若D3已可用,却把停机改成能源,问题在证据使用。若忠实但不完整,则应检查未覆盖问题部分。笼统“回答错误”会掩盖三种不同运行原因。
对能量问题,追加搜索可能合理,但需停止条件,例如搜索次数或成本上限,并明确说明剩余证据缺口。反复检索直到找到貌似有利的句子,不等于验证。应保存文档标识、版本、所用片段及其对应陈述。来源变化时,这些记录可定位需重新检查的回答,而不是把URL当成永恒证据。
可复现练习证明了什么
附带代码保存四份文档、五个候选陈述、允许关系及三种回答,用集合运算计算召回、支持与覆盖,并检查预期结果。在支持表查询为常数成本时,计数复杂度随陈述—引用对数量线性增长;现实中困难且昂贵的是正确建立支持表。本程序不解决这个语义问题,没有随机数,因此无需种子。
真实评估需要有代表性的问题、冻结或版本化来源、保存的回答、切分规则及分歧处理。应区分可回答、信息缺失和文档冲突的情况。这三个场景不估计企业错误率,也不能决定通用接受阈值。它们表明即使全部链接正常,指标仍可分歧,因此流程必须检查内容,而不仅是链接存在。
回答最初的问题
只有当引用指向适用且真正支持陈述的证据时,它才使陈述可核查。本档案中,检索与链接存在率可达100%,但仅三分之一陈述受支持。缩成一句能消除错误,却遗漏三分之二已有事实。更好的回答忠实报告来源,保留单位、版本、条件,并说明年度能量的证据边界。问题、陈述和证据之间可验证的关系,才让文档代理有用。
参考资料与透明说明
Tianyu Gao、Howard Yen、Jiatong Yu、Danqi Chen,Enabling Large Language Models to Generate Text with Citations,EMNLP 2023,6465–6488页。已阅读引用质量、方法与实验比较相关章节。P7档案完全虚构,与EL-AI客户、设施或产品无关。本文不表示CMS或公司其他产品已提供自动验证器。
Gao et al. (2023) — Enabling Large Language Models to Generate Text with Citations.
support = {"c1": {"D1"}, "c2": {"D3"}, "c3": {"D3"},
"c4": set(), "c5": set()}
required = {"c1", "c2", "c3"}
answer = [("c1", "D1"), ("c4", "D3"), ("c5", "D4")]
good = {claim for claim, doc in answer if doc in support[claim]}
print("support:", len(good)/len(answer))
print("coverage:", len(good & required)/len(required))
# The support labels are stipulated for this synthetic corpus.
# This code is not a natural-language entailment model.
代码、数据与说明 · JSON. 教学计算使用 Python 3.14.0,图使用 Matplotlib 3.11.2。分析由 AI 辅助,不声称经过同行评审或人工审核。原创 ImageGen 封面仅作示意,不记录 EL-AI 人员、场所或实际安装。来源查阅于 2026 年 9 月 28 日。

