ELAI S.r.l.

模型懂行业,为何需求变化后仍会出错?

请求频率变化不等于规则变化。精确算例说明数据加权何时能修正评估,何时会失效。

模型懂行业,为何需求变化后仍会出错?

懂词汇不等于懂新环境

专业模型正确使用行业词汇并通过历史测试来分流技术支持请求。服务变化后,优先级却不再可靠。究竟请求构成改变,还是紧急的判定规则改变?两种解释需要不同干预。增加文档或重训前,应先辨明哪种关系发生变化。

摘要。用两类合成工单推导重要性加权,即调整旧样本权重以代表新总体。输入频率改变而输入到答案的关系稳定时可奏效。再构造输入相同、规则不同的世界:权重不变,但评估乃至分类器排序都错误。结果来自精确枚举,不是语言模型实测性能。

两种分布,两个问题

x为工单类型A或B,y为标签,1紧急、0不紧急。p(x)表示类型频率,条件概率p(y=1|x)表示该类型内部紧急比例,竖线表示给定该类型。B变多本身并不表示B更紧急。联合分布结合两者:p(x,y)=p(x)p(y|x)。

源世界s中A占80%、B占20%,A内90%紧急,B内60%。目标世界t中A降至20%、B升至80%,暂保持90%、60%的条件比例。这叫协变量偏移:p(x)变而p(y|x)不变。s、t表示源和目标,不是同一样本的两次测量。

历史16%错误率变成34%

分类器U总答紧急,故意简单以隔离评估而非推荐系统。零一损失在预测与标签不同时计一次错。U在A内错10%、B内40%。源风险即总体平均错误为0.8×0.1+0.2×0.4=0.16,目标为0.2×0.1+0.8×0.4=0.34。模型没变,更容易错的请求增多了。

旧标签能重建新风险吗?每类贡献乘目标/源频率比:w(A)=0.25,w(B)=4。A算四分之一,B算四倍。不是编造新标签,而是改变旧案例代表当前目标总体的程度。

R_t(f) = Σ_x Σ_y p_t(x)p_t(y|x) L(f(x),y) p_t(y|x) = p_s(y|x), w(x) = p_t(x)/p_s(x) R_t(f) = Σ_x Σ_y p_s(x)p_s(y|x) w(x)L(f(x),y)

f是分类器,L在出错时为1,否则0,求和遍历类型与标签。第二行是关键假设。用源条件分布替换目标条件分布,才能将新平均写为旧的加权平均。替换若不成立,最后一行就非目标风险。且目标概率为正处源概率也须正,加权无法补出从未观察的类别。

类型标签y每1000计数权重
A0800.25
A17200.25
B0804
B11204

表是精确构造的合成集合,不是随机样本。U错80个不紧急A、80个不紧急B,共160/1000。加权错数80×0.25+80×4=340,总权重仍1000,所以风险0.34,等于仅频率改变时的目标风险。代码用有理分数并存计数,无需种子或训练。

输入相同,规则不同:加权失效之处

保持目标A占20%、B占80%,但改变服务规则:A仅10%紧急,B仍60%。此合成条件变化仅隔离问题,不声称真实原因。U在A上的错率从10%升至90%,新风险0.2×0.9+0.8×0.4=0.50。旧数据加权仍0.34,因为没有新标签信息。

再比较V:A答不紧急,B答紧急。第一个目标世界中V错90%的A与40%的B,风险0.50,比U差。规则变化后只错10%的A,风险0.34,优于U。历史加权数据仍保留旧排序。这会反转模型选择,不仅是分数小偏差。两者都是预设规则,非用测试数据训练。

U、V的精确错误率。仅频率变化时加权历史误差等于目标误差,规则改变则排序反转。全部为合成数据。
U、V的精确错误率。仅频率变化时加权历史误差等于目标误差,规则改变则排序反转。全部为合成数据。

只监测p(x)无法区分两个目标世界,均为20%A、80%B。这是信息边界,不能靠同样输入上的更复杂检测器解决。需新标签、可验证结果或可靠规则变更信息。标签延迟则评估延迟;若只收集争议案例标签,会产生需建模的选择过程,不自动代表全部工单。

即使假设成立,少量样本也可能权重过大

权重精确是因为分布由我们构造。实际需估计,源中罕见类别可能获得极大权重,放大标签错误。描述权重集中度可用n_eff=(Σ_i w_i)²/Σ_i w_i²。800个0.25、200个4得1000²/3250≈307.69。不是删除了692条,也不能单独给置信区间,只提示影响不均。

截断权重可降低不稳定,却破坏上述精确恒等式,是需评估的取舍,不是免费改进。更好的词汇表示可帮助区分先前混淆类别,却不证明业务规则稳定。更新文档、修订标签和修正总体针对不同部分,混淆会让成败原因难解释。

行业模型项目应带走的结论

声称已适应领域前,应说明变化与验证内容。仅条件稳定时,加权将16%精确修正为34%;规则变化后真实错误50%,需要新信息。行业词汇熟悉不能替代诊断。有效评估须连同分数报告总体、时期、标签定义及迁移假设。未测EL-AI模型,而是使专业化项目的一项条件可审查。

来源与实验范围

Sugiyama, Krauledat, Müller (2007), Covariate Shift Adaptation by Importance Weighted Cross Validation, JMLR 8:985–1005, sections 2–4.1.

2007年论文在条件分布稳定、理论上密度比已知时研究加权交叉验证。4.1节用150样本、十折验证、1000次重复,以线性模型拟合sinc目标,作者报告该协议下风险估计优于未加权验证。本文未复现,而是对两个固定分类器验证离散恒等式并构造违背假设的情况。不是新研究或语言网络普遍结论。

片段计算U的三个误差;归档加入V、联合表、总权重、集中度和断言。计算随类型-标签单元数增长,无数值优化。未来真实工单试验需定义业务标签、分离选模与评估、检查新案例覆盖,本文未执行。

from fractions import Fraction as F
source = [F(4,5), F(1,5)]
target = [F(1,5), F(4,5)]
old_error = [F(1,10), F(2,5)]
new_error = [F(9,10), F(2,5)]
weights = [t/s for t,s in zip(target,source)]
print('source', float(sum(s*e for s,e in zip(source,old_error))))
print('weighted', float(sum(s*w*e for s,w,e in zip(source,weights,old_error))))
print('changed rule', float(sum(t*e for t,e in zip(target,new_error))))

代码、数据与说明 · JSON. 教学计算使用 Python 3.14.0,图使用 Matplotlib 3.11.2。分析由 AI 辅助,不声称经过同行评审或人工审核。原创 ImageGen 封面仅作示意,不记录 EL-AI 人员、场所或实际安装。来源查阅于 2026 年 9 月 29 日。