El número que decide si un documento avanza solo
Una empresa usa un clasificador para distinguir dos tipos de documento. Cada entrada recibe una categoría y un número: «confianza del 90%». Parecería razonable revisar manualmente solo los casos inferiores al 80%. Pero un modelo demasiado seguro deja pasar documentos incorrectos con la misma certeza aparente que los correctos. El problema no es cosmético: ese número condiciona trabajo, errores y expectativas.
La pregunta es concreta: ¿podemos hacer más fiable la confianza sin reentrenar el clasificador? Construimos un ejemplo que declara 90%, pero acierta solo 60 de 100 documentos. Calculamos una temperatura que corrige la diferencia y mostramos por qué no añade ningún acierto, por qué puede empeorar en otro contexto y cómo una media perfecta oculta dos grupos mal calibrados. Los datos se construyen para explicar el mecanismo; no proceden de clientes.
Tres cantidades que no debemos confundir
La categoría predicha es una decisión discreta: documento A o B. La exactitud es la proporción de decisiones correctas en un conjunto etiquetado. La confianza es un valor asignado a la categoría elegida antes de conocer el resultado. Una clasificación con confianza del 90% no está demostrada: estamos leyendo una predicción sobre su corrección, que requiere verificación en casos comparables.
Un significado deseable del 90% sería que, entre muchos casos con ese valor, unos nueve de cada diez resultan correctos. Es la calibración de confianza. No promete exactamente nueve aciertos en cada bloque consecutivo de diez ni identifica el error. La frecuencia corresponde a una población y contexto; una muestra finita la estima. Medimos la corrección de la clase ganadora, no la veracidad de una respuesta generativa que declara verbalmente estar segura.
De puntuaciones internas a probabilidades
Para seguir el cálculo bastan probabilidades, medias y logaritmos naturales. Quien no use derivadas puede leer la demostración como justificación de la regla final. Supongamos que el modelo produce dos puntuaciones reales, llamadas logits: z₀ y z₁. No son probabilidades y pueden ser negativas. Softmax las transforma en dos números positivos cuya suma es uno. Una diferencia mayor produce una preferencia más marcada.
T es un parámetro adimensional llamado temperatura; no mide calor físico. T = 1 conserva el modelo; aumentar T acerca ambas probabilidades a 0,5. La confianza q es la mayor probabilidad. El margen entre puntuación ganadora y perdedora es siempre m = ln 9, aproximadamente 2,197225. La clase ganadora cambia entre documentos, pero el margen se mantiene para aislar el problema de la confianza declarada.
La expresión sale al dividir numerador y denominador de softmax por la exponencial de la puntuación ganadora. Con T = 1, exp(−ln 9) = 1/9, por tanto q = 9/10. Importa la diferencia, no las puntuaciones absolutas: sumar la misma constante no altera nada. Dividir por un número positivo mantiene también el orden. La clase ganadora sigue ganando aunque baje su probabilidad.
Elegir la temperatura con un criterio verificable
Construimos cien registros de calibración con sesenta clasificaciones correctas y cuarenta incorrectas. Las etiquetas sintéticas las determina el script: no inferimos sobre cien documentos reales. ¿Cuánto bajar la confianza? Usamos la media de la log-verosimilitud negativa, NLL. Penaliza la probabilidad asignada a la etiqueta verdadera: un error seguro cuesta más que uno dubitativo. En el caso binario, un registro correcto asigna q a la verdad; uno incorrecto, 1 − q.
a es la fracción correcta y q la confianza común. El logaritmo natural expresa la pérdida en nats, unidad informativa adimensional. Con q = 0,9 obtenemos L = 0,984250 nats por registro. No significa un 98% de errores: la exactitud sigue en 60%. Ahora evaluamos probabilidades, no solo contamos decisiones acertadas. Para hallar el mínimo derivamos respecto a q y buscamos pendiente nula.
Entre cero y uno el denominador de la primera derivada es positivo. Si q supera a, reducirlo baja la pérdida; si es menor, conviene aumentarlo. La segunda derivada positiva hace de q = a el mínimo único. En este conjunto homogéneo, la mejor confianza coincide con la frecuencia observada. No hemos demostrado que esa frecuencia muestral sea la probabilidad exacta del mundo exterior.
La fórmula resuelve q(T) = a. Una temperatura mayor que uno modera la confianza y reduce la pérdida de unos 0,984 a 0,673. Los sesenta aciertos siguen siendo sesenta. Corregimos cómo interpretamos el modelo, no sus categorías. La fórmula cerrada funciona porque todos los márgenes son iguales. Con márgenes distintos debemos optimizar la suma de pérdidas, no sustituir simplemente la exactitud media en esta ecuación.
Hay un límite estructural: con margen y temperatura positivos la confianza ganadora supera 0,5. Si acertáramos menos de la mitad en este ejemplo, ninguna temperatura finita llevaría q a esa frecuencia. Para a = 0,5 hace falta T → infinito. Un clasificador sistemáticamente invertido exige revisar el modelo o las clases; un parámetro de confianza no resuelve cualquier error.
La evaluación no debe elegir T
Ajustar T y celebrar el resultado en los mismos cien registros solo describe el ajuste a calibración. Construimos otro conjunto con identificadores distintos y setenta aciertos. Conservamos T = 5,419023 sin reajustarlo. Su pérdida pasa de 0,764528 a 0,632465 nats y la confianza es 60% frente a exactitud del 70%. Está más cerca de la frecuencia correcta, pero no coincide.
La separación es lógica, no evidencia estadística de generalización: nosotros elegimos los conteos del segundo conjunto. El script no simula muestreo aleatorio ni justifica intervalos empíricos de confianza. Un proyecto real necesita datos representativos, separación del entrenamiento y calibración, etiquetas fiables y protocolo previo al test. Volver a elegir T tras ver la evaluación convierte ese test en otro conjunto de desarrollo.
| Conjunto | Correctos | NLL T=1 | NLL T* |
|---|---|---|---|
| Calibration | 60% | 0.984250 | 0.673012 |
| Holdout | 70% | 0.764528 | 0.632465 |
| Shift | 95% | 0.215222 | 0.531099 |
Cambiar el contexto puede invertir la ventaja
La tercera fila es un contraejemplo construido: mismos márgenes, pero noventa y cinco aciertos de cien. Podría representar un flujo más fácil, sin simular una causa concreta. La confianza original del 90% dista cinco puntos porcentuales de la frecuencia; la calibrada al 60%, treinta y cinco. La NLL empeora de 0,215222 a 0,531099 nats. Reducir seguridad no siempre es prudente: puede convertirse en subestimación sistemática.

Para leer el gráfico seguimos la curva del 60%: baja hasta la línea discontinua y luego sube hacia una predicción casi uniforme. En la curva del 95%, ese punto ya subestima la confianza. No comparamos tres redes entrenadas, sino tres distribuciones de etiquetas construidas alrededor de las mismas puntuaciones. Por eso debemos verificar la calibración cuando cambian documentos, proveedores, idiomas o reglas.
Una media perfecta puede ocultar dos problemas
Hasta ahora resumimos cada conjunto en un número. Un indicador habitual, Expected Calibration Error o ECE, agrupa confianzas en intervalos y compara exactitud y confianza media dentro de cada uno. Suma las diferencias absolutas ponderadas por número de registros. En datos finitos es una estimación que depende también de los intervalos, no una certificación universal de fiabilidad.
N es el total y n_b los registros del intervalo b; los vacíos no contribuyen. Todas nuestras confianzas calibradas valen 0,6 y caen en un intervalo. En el primer conjunto ECE = |0,6 − 0,6| = 0, salvo redondeo numérico. Dividamos ahora los cien casos en grupos iguales: A acierta 45 de 50, B solo 15 de 50. El total sigue en sesenta y todos declaran 60%.
A queda subestimado treinta puntos y B sobreestimado treinta. El ECE global es cero porque los intervalos mezclan errores antes de tomar el valor absoluto. La media ponderada de los ECE calculados por grupo sería 0,30. Ninguna T común asigna 90% a un grupo y 30% al otro con el mismo margen: la transformación carece de flexibilidad e información útil.
Los grupos podrían ser tipos de escaneo o familias documentales, pero aquí son etiquetas sintéticas. El contraejemplo no demuestra defectos de un producto o idioma concreto. Plantea una pregunta: ¿la probabilidad informa donde se utilizará? Dividir todo en grupos diminutos tampoco resuelve el problema: las frecuencias se vuelven inestables. Hacen falta grupos motivados por el proceso, muestras adecuadas y evaluación fuera de los datos que eligen las correcciones.
La decisión operativa cambia aunque el clasificador no mejore
Volvamos a la regla: automatizar si q ≥ 0,8. Antes pasan los cien documentos; después ninguno. La cobertura, fracción gestionada automáticamente, cae del 100% al 0%. No podemos anunciar exactitud del 100% entre aceptados: el conjunto está vacío y la proporción correcta no está definida. Hemos mostrado un problema de confianza, sin construir un flujo productivo sostenible.
Una decisión real relaciona probabilidades, costes de error, capacidad de revisión y opciones de aplazamiento. No estimamos esos costes ni recomendamos un umbral de producción. Comparar porcentajes de confianza es insuficiente: hay que distinguir exactitud del clasificador, calidad probabilística, cobertura y rendimiento del proceso completo, incluyendo los documentos enviados a revisión.
Alternativas, evidencia publicada y reproducibilidad
La temperatura usa un parámetro y conserva el orden de clases por entrada. Una transformación afín de logits añade un desplazamiento; mapas por clase o transformaciones más flexibles pueden cambiar decisiones. Ganan expresividad, pero se estiman con datos: más libertad no implica más fiabilidad fuera de muestra. Agrupar probabilidades en intervalos también intercambia detalle por observaciones disponibles en cada estimación.
Guo, Pleiss, Sun y Weinberger estudian calibración de imágenes y documentos con conjuntos separados en ICML 2017. La comparación muestra beneficios frecuentes, no universales, de la temperatura. Es una referencia metodológica; no reproducimos sus redes ni benchmarks.
En el adjunto, make_data construye etiquetas y logits; confidence transforma; nll evalúa probabilidades; run fija T antes de evaluar los otros conjuntos. Las aserciones comprueban identificadores distintos, clases invariantes y dirección de cambios de pérdida. No hay azar ni semilla necesaria. La coma flotante hace que el ECE teóricamente nulo aparezca cerca de 10⁻¹⁶ en JSON: es redondeo, no un descubrimiento.
¿Qué significa entonces ese 90%?
Significa nueve aciertos de diez solo como interpretación probabilística que debemos verificar en casos comparables y en el contexto de uso. La temperatura corrige exceso de confianza sin cambiar el clasificador; calculamos cómo y con qué coste de cobertura. Una buena media no garantiza cada subgrupo y una corrección útil en un flujo puede empeorar otro. Para un modelo vertical preguntemos también: «¿dónde verificamos que estos números significan lo que aparentan?».
Bibliografía
from experiment import run
r = run()
print(round(r['temperature'], 6))
for m in r['metrics']:
print(m['dataset'], round(m['confidence'], 2),
round(m['accuracy'], 2), round(m['nll_nats'], 6))
Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 4 de octubre de 2026.

