Resumen: la calidad de la búsqueda depende de lo que selecciona
Un agente puede generar muchas soluciones y elegir la mejor puntuada por un verificador. La probabilidad de que exista una correcta crece con los intentos; la de que la elegida sea correcta puede disminuir. Construimos un ejemplo discreto con un generador correcto el 60% de las veces y un verificador con exactitud binaria del 99%. Best-of-n alcanza el 94,20% con cinco candidatos, pero cae al 36,60% con cien. No hay contradicción: el máximo explora la cola de errores del verificador.
Es un análisis matemático didáctico, no un benchmark de un LLM ni de un agente EL-AI. Requiere probabilidad elemental, eventos independientes y sumas geométricas. Distinguimos disponibilidad de una buena solución, reconocimiento y política de parada. Python calcula los números directamente del modelo declarado; no proceden de conversaciones, pruebas de software ni clientes reales.
1. Un verificador casi siempre correcto, pero vulnerable en la cola
Cada candidato independiente pertenece a tres categorías: C correcto, probabilidad 0,60 y puntuación 1; O error ordinario, 0,39 y puntuación 0; E error raro sobrevalorado, 0,01 y puntuación 2. E no implica un ataque deliberado: puede ser una solución convincente que explota una laguna del criterio. El verificador ordena E por encima de C y C de O. Los empates dentro de una categoría no cambian la corrección.
Con umbral score≥1 clasifica correctamente todos los C y O: exactitud 0,60+0,39=0,99. Comparar un candidato correcto con uno incorrecto también parece sólido: gana el correcto el 97,5%, pues solo 0,01/0,40=2,5% de los errores son E. Ninguna métrica describe elegir el máximo entre cien candidatos. Esa política cambia la distribución de respuestas que recibe el usuario.
2. Derivar la corrección de la respuesta elegida
La respuesta elegida es correcta si no aparece E y aparece al menos un C. No ver E en n extracciones independientes tiene probabilidad 0,99^n. Restamos el caso de todos O, con probabilidad 0,39^n. Basta un E para que el máximo sea erróneo; si solo hay O también lo es. Los tres eventos disjuntos cubren todos los resultados y el script comprueba que suman uno.
La última línea corresponde a un selector ideal que reconoce siempre una respuesta correcta cuando existe. Es un límite de disponibilidad, no el rendimiento del verificador real. Para n=5, disponibilidad 98,976% y selección efectiva 94,196763%. Para n=100 la disponibilidad es casi uno, pero E aparece en el 63,396766% de los grupos y se elige. Más variedad no corrige automáticamente un criterio que prefiere un error a la verdad.
| n | Correcta elegida | E elegido | Oráculo |
|---|---|---|---|
| 1 | 0.60000000 | 0.01000000 | 0.60000000 |
| 2 | 0.82800000 | 0.01990000 | 0.84000000 |
| 5 | 0.94196763 | 0.04900995 | 0.98976000 |
| 10 | 0.90430067 | 0.09561792 | 0.99989514 |
| 50 | 0.60500607 | 0.39499393 | 1.00000000 |
| 100 | 0.36603234 | 0.63396766 | 1.00000000 |

3. Encontrar analíticamente el presupuesto óptimo
Sea P_n la probabilidad de elegir correctamente. El incremento P_(n+1)−P_n es −0,01·0,99^n+0,61·0,39^n: otro candidato ayuda solo si el segundo término supera al primero. El beneficio rescata grupos de errores ordinarios; el daño introduce E en un grupo antes utilizable. La razón (0,39/0,99)^n decrece estrictamente, por lo que hay un único cambio de signo. El máximo entero es n=5, comprobado enumerando de 1 a 1000.
Cinco no es una recomendación de producto: depende de probabilidades inventadas. Manteniendo P(C)=0,60 y P(E)=ε obtenemos (1−ε)^n−(0,40−ε)^n. Para ε=0,001 el mejor presupuesto es 7 y la probabilidad 99,1411%; para ε=0,05 es 3 y 81,45%. Reducir errores con puntuación alta modifica calidad máxima y presupuesto útil. Un coste positivo por generación o verificación puede favorecer parar antes del máximo de exactitud.
4. Cambiar la política: primera aceptada y abstención
Otra política examina candidatos en orden, para en el primero con score≥1 y se abstiene si ninguno pasa en n intentos. Pasan C y E; se rechaza O. La probabilidad de responder es 1−0,39^n. La probabilidad conjunta de responder correctamente es 0,60·Σ_(j=0)^(n−1)0,39^j, pues j errores ordinarios pueden preceder al primer C. Dividiendo por la probabilidad de responder resulta 0,60/0,61=98,3607%, independiente de n.
Esto no convierte al verificador en un oráculo: alrededor del 1,64% de las respuestas aceptadas sigue siendo incorrecto. Evita preferir sistemáticamente E a C tras encontrar una respuesta aceptable. Hay que informar corrección condicionada a responder y cobertura, la fracción de casos respondidos. Mucha abstención puede parecer perfecta si solo se publica la primera. Los intentos esperados son (1−0,39^n)/0,61, incluyendo agotar el presupuesto, con límite aproximado de 1,63934, solo bajo nuestras hipótesis.
5. Qué rompe el modelo y cómo evaluar un agente
La independencia es sustancial. Si cien candidatos copian el mismo resultado, la corrección sigue en 0,60 y las potencias no valen. Muestras distintas también pueden compartir una laguna del modelo o del test. En un agente adaptativo cada intento depende de errores previos y mensajes del verificador; las probabilidades pueden cambiar. Hay que medir la política completa con problemas separados entre desarrollo y prueba, no extrapolar una estimación por candidato al presupuesto.
Un segundo verificador ayuda solo si añade evidencia pertinente. Repetir el mismo juicio con un error compartido no justifica multiplicar probabilidades de falso positivo. Para un agente de código, pruebas independientes de las usadas durante la búsqueda pueden comprobar una especificación, pero no todas las propiedades del programa. Conservar candidatos, puntuaciones, decisiones, abstenciones, costes y criterios distingue fallos de generación, reconocimiento y política.
6. Relación con la literatura y conclusión
Gao, Schulman y Hilton estudian sobreoptimización de modelos de recompensa con best-of-n y PPO. En la versión arXiv v1 de 2022 consultada, la referencia “gold” es otro modelo, no verdad humana medida en cada paso. Métodos y resultados motivan evaluar por separado la proxy optimizada. Nuestro ejemplo no reproduce sus curvas ni modelos: aísla un mecanismo con tres categorías de probabilidades conocidas. No es una revisión del estado del arte ni prueba que toda búsqueda best-of-n empeore.
La conclusión es más precisa que “menos intentos es mejor”: evaluar el presupuesto junto con la distribución de errores y la regla de selección. Que exista una respuesta correcta no garantiza devolverla. El archivo calcula probabilidades, comprueba la partición de eventos y repite la optimización para tres frecuencias del error raro. Los números no implican aleatoriedad, modelo entrenado ni resultados operativos de EL-AI.
for n in [1, 2, 5, 10, 50, 100]:
correct = .99**n - .39**n
oracle = 1 - .4**n
print(n, correct, oracle)
print("precision_first_pass", .6/.61)
Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 24 de septiembre de 2026.

