摘要:搜索质量取决于选择了什么
智能体可以生成多种解答,并选择验证器评分最高的一项。至少存在一个正确解答的概率随尝试次数增加,但所选解答正确的概率可能下降。我们构造离散实例:生成器正确率为 60%,验证器作为二分类器的准确率为 99%。best-of-n 在五个候选时达到 94.20%,一百个时却降到 36.60%。这并不矛盾:取最大值会探索验证器错误的尾部。
本文是教学数学分析,并非 LLM 或 EL-AI 智能体基准测试。读者需要初等概率、独立事件和等比求和知识。我们区分三个常被混淆的对象:好解答是否存在、能否识别,以及何时停止的策略。数值由 Python 根据明确模型直接计算,不来自对话、软件测试或真实客户。
1. 通常正确、尾部脆弱的验证器
每个独立候选属于三类之一:C 为正确解答,概率 0.60、评分 1;O 为普通错误,概率 0.39、评分 0;E 为被高估的稀有错误,概率 0.01、评分 2。E 不一定是蓄意攻击,也可能是形式上有说服力、恰好利用评价缺口的解答。验证器始终将 E 排在 C 前、C 排在 O 前。类别内部同分不影响正确性。
若接受阈值为 score≥1,所有 C 与 O 都被正确分类,准确率为 0.60+0.39=0.99。正确与错误候选的成对比较也很强:正确者胜率 97.5%,因为错误中只有 0.01/0.40=2.5% 属于 E。但两种指标都没有描述从一百项中取最高分的操作。该策略改变了用户最终看到的答案分布。
2. 推导所选答案的正确概率
所选答案正确,当且仅当没有 E 且至少出现一个 C。n 次独立抽样中无 E 的概率为 0.99^n,再减去全为 O 的概率 0.39^n。只要出现一个 E,最高分就是错误;若全部为 O,也错误。这三个互斥事件覆盖所有情况,脚本验证其概率和为一。
最后一行对应理想选择器:只要存在正确答案,就一定识别出来。它衡量候选可用性,不代表实际验证器表现。n=5 时可用性为 98.976%,实际选择正确率为 94.196763%。n=100 时可用性几乎为一,但 63.396766% 的候选组出现 E,且 E 被选中。更多解答变化不能自动修正一个偏爱错误的评价标准。
| n | 选中正确 | 选中 E | 理想选择 |
|---|---|---|---|
| 1 | 0.60000000 | 0.01000000 | 0.60000000 |
| 2 | 0.82800000 | 0.01990000 | 0.84000000 |
| 5 | 0.94196763 | 0.04900995 | 0.98976000 |
| 10 | 0.90430067 | 0.09561792 | 0.99989514 |
| 50 | 0.60500607 | 0.39499393 | 1.00000000 |
| 100 | 0.36603234 | 0.63396766 | 1.00000000 |

3. 用解析方法寻找最优预算
记 P_n 为选择正确概率,则增量 P_(n+1)−P_n=−0.01·0.99^n+0.61·0.39^n。只有第二项超过第一项,增加候选才有益。收益来自挽救全为普通错误的候选组;损失来自向原本可用的组引入 E。比值 (0.39/0.99)^n 严格下降,因此只改变一次符号。整数最优值为 n=5,也用 1 至 1000 的枚举核验。
五不是产品建议,它依赖合成概率。保持 P(C)=0.60、设 P(E)=ε,公式变为 (1−ε)^n−(0.40−ε)^n。ε=0.001 时最优预算 7、正确率 99.1411%;ε=0.05 时最优预算 3、正确率 81.45%。减少高分错误会同时改变最佳质量和有效预算。另外,每次生成或验证的正成本可能使准确率达到峰值前停止更划算。
4. 改变策略:首个通过者与弃答
再考虑另一策略:按顺序检查候选,遇到首个 score≥1 就停止;n 次内无人通过则弃答。C 与 E 都通过,O 被拒绝。回答概率为 1−0.39^n。正确回答的联合概率为 0.60·Σ_(j=0)^(n−1)0.39^j,因为首个 C 前可能有 j 个普通错误。除以回答概率,得到恒定的 0.60/0.61=98.3607%,与 n 无关。
该规则没有把验证器变成理想选择器:被接受答案仍约有 1.64% 错误。它只是避免在找到可接受答案后系统性地偏爱 E 而非 C。比较必须同时报告回答条件下的正确率和覆盖率,即实际回答比例。若只公布前者,经常弃答的系统也可能显得完美。包括预算耗尽情况,期望尝试次数为 (1−0.39^n)/0.61,极限约 1.63934,但仅在本例假设下成立。
5. 模型何时失效,如何评估智能体
独立性是实质条件。如果一百个候选都是同一结果的副本,正确率仍是 0.60,上述幂次公式不成立。不同样本也可能共享模型或测试的盲点。在自适应智能体中,每次尝试依赖之前错误和验证器反馈,概率可能逐步变化。因此应在开发与测试问题分离的条件下测量整套策略曲线,而不是把单候选估计机械外推到大预算。
第二个验证器只有增加相关证据才有帮助。若重复相同判断且共享错误,就不能把两个假阳性概率相乘。对编程智能体,与搜索阶段测试独立的测试能检查某些规范,但不会自动证明程序所有性质。应保留候选、评分、决定、弃答、成本及正确性标准,以区分生成失败、识别失败和策略失败。
6. 与文献的关系及结论
Gao、Schulman 与 Hilton 研究了 best-of-n 和 PPO 下奖励模型的过度优化。所读 2022 年 arXiv v1 中,“gold”参考本身也是模型,并非每步都测量的人类真实判断。方法和结果说明优化代理指标需要独立评估。本例不复现其曲线或模型,而是用三类已知概率隔离一种机制。它不是最新技术综述,也没有证明所有 best-of-n 搜索都会变差。
技术结论比“尝试越少越好”更精确:预算必须与验证器错误分布及选择策略一起评估。候选中存在正确答案,不保证智能体将它返回。附件计算全部概率、检查事件划分,并对三种稀有错误频率重新求最优值。这些数字不涉及随机模拟、已训练模型或 EL-AI 实际运营成果。
for n in [1, 2, 5, 10, 50, 100]:
correct = .99**n - .39**n
oracle = 1 - .4**n
print(n, correct, oracle)
print("precision_first_pass", .6/.61)
代码、数据与说明 · JSON. 教学计算使用 Python 3.14.0,图使用 Matplotlib 3.11.2。分析由 AI 辅助,不声称经过同行评审或人工审核。原创 ImageGen 封面仅作示意,不记录 EL-AI 人员、场所或实际安装。来源查阅于 2026 年 9 月 24 日。

