Un expediente, dos vías y una pregunta más
Un agente de IA debe encauzar un expediente empresarial: continuar la tramitación ordinaria o enviarlo a revisión manual. Puede consultar otra fuente documental, pero cada consulta consume tiempo y recursos. Seguir buscando parece prudente; detenerse parece arriesgado. La pregunta útil es más precisa: ¿puede la siguiente respuesta cambiar la elección lo suficiente para justificar su coste? Calcularemos esa respuesta sin suponer que más llamadas a herramientas producen automáticamente un agente mejor.
Resumen. Construimos un problema sintético con dos acciones, una excepción oculta y herramientas imperfectas. Derivamos el umbral de intervención, actualizamos probabilidades tras una respuesta y comparamos el coste esperado antes y después de consultar. La primera comprobación útil reduce el coste de 12 a 8,88 unidades, incluido el precio de la pregunta. Una comprobación menos discriminante tiene valor decisorio nulo en el mismo caso. Por último, una estrategia que decide si repetir la consulta según la primera respuesta alcanza 8,448 unidades bajo supuestos más fuertes. Son cálculos didácticos ejecutados, no mediciones de un producto de EL-AI ni resultados de un modelo lingüístico.
Antes de los números: qué puede decidir el agente
Bastan porcentajes, medias ponderadas y distinguir un hecho de lo que sabemos de él. H indica si existe una excepción en el expediente: vale 1 cuando existe y 0 en caso contrario. La comprobación no crea ni resuelve la excepción; solo aporta un indicio. Las acciones son S, tramitación estándar, y R, revisión. Esta separación importa: evaluamos una petición de información, no una herramienta que modifica directamente el expediente o ejecuta una transacción.
Asignamos costes sintéticos en una unidad convencional común. Elegir S cuando existe una excepción ocasiona una pérdida de 100; sin excepción cuesta cero. R siempre cuesta 12 y, en el modelo, evita pérdidas adicionales. No son euros, tiempos medidos ni tarifas empresariales. Suponer que la revisión resuelve el caso simplifica el cálculo: una revisión real puede equivocarse y requeriría otra tabla de costes. El precio de consultar, fijado en 2, también es didáctico y debe expresarse en la misma unidad.
| Acción | H = 0 | H = 1 |
|---|---|---|
| S | 0 | 100 |
| R | 12 | 12 |
Introducimos p, la probabilidad de que el expediente contenga una excepción antes de comprobarlo. En el ejemplo p = 0,20: una población hipotética con un 20% de excepciones. No es una declaración de confianza del modelo ni un porcentaje extraído de una frase del asistente. Es un parámetro asignado. En una aplicación habría que estimarlo y validarlo sobre casos pertinentes, sin trasladar sin comprobación una frecuencia observada en otra población. Por ahora lo suponemos conocido para aislar el problema decisorio.
¿Cuánto cuesta decidir sin más información?
La primera fórmula pregunta qué acción cuesta menos, en promedio, con la información disponible. El coste esperado de S es 100p: la pérdida 100 ocurre con probabilidad p. R sigue costando 12. Llamamos L₀ al menor de ambos. El subíndice cero recuerda que aún no hemos comprado ninguna comprobación. La media describe casos repetidos bajo los mismos supuestos, sin garantizar el coste de un expediente individual.
El umbral p* es 0,12. Por debajo del 12% conviene S; por encima, R; en el umbral ambas acciones son equivalentes en el modelo. Con p = 20% enviaríamos el expediente a revisión. Ya tenemos una referencia concreta para comparar cualquier búsqueda. Sin ella, afirmar que una herramienta es precisa o que el agente reunió muchas evidencias no demuestra que consultar mejorara el resultado. Hace falta una elección que mejorar y una consecuencia con la que medirla.
La herramienta responde: cómo cambia lo que sabemos
La herramienta A devuelve una señal positiva, +, o negativa, −. Positiva significa indicio de excepción, no certeza de que exista. Definimos la sensibilidad s = P(+ | H = 1) = 0,8: el 80% de las excepciones reales produce señal positiva. Definimos la tasa de falsos positivos f = P(+ | H = 0) = 0,1: el 10% de los expedientes ordinarios también genera alarma. La barra vertical significa “condicionado a”. Son supuestos sintéticos, no prestaciones atribuidas a un archivo o servicio existente.
Antes de actualizar la probabilidad necesitamos saber con qué frecuencia llega cada respuesta. Un positivo puede proceder de una excepción detectada o de una falsa alarma. Sumamos ambas posibilidades, incompatibles para un mismo expediente. Si z es la probabilidad de respuesta positiva, obtenemos 0,24. Entre 1.000 casos hipotéticos distribuidos exactamente según el modelo habría 160 verdaderos positivos y 80 falsos positivos: 240 positivos en total. Es un recuento esperado construido con los parámetros, no una muestra recogida realmente.
Las dos últimas líneas aplican la regla de Bayes: entre los casos compatibles con la respuesta, ¿qué proporción contiene realmente la excepción? Tras un positivo, 160 de los 240 casos esperados son excepciones: p₊ = 2/3, aproximadamente 66,67%. Tras un negativo quedan 40 excepciones entre 760 casos: p₋ = 1/19, aproximadamente 5,26%. Solo la rama negativa cruza el umbral del 12%. Por tanto, + sigue llevando a R, mientras que − permite elegir S. Una señal negativa no certifica la ausencia de excepción: cambia el equilibrio de costes.
El valor se calcula antes de conocer la respuesta
Al consultar todavía no sabemos qué rama ocurrirá. Debemos ponderar el coste de la mejor decisión de cada rama por su probabilidad. L₁ denota el coste después de observar la señal, antes de añadir el precio de consultar. El valor bruto V es la reducción respecto a L₀. “Bruto” evita una confusión práctica: la información puede ser útil y resultar demasiado cara. El coste total de la estrategia es c + L₁, con c = 2.
El resultado significa que, repitiendo idealmente el procedimiento en la población supuesta, el coste medio baja de 12 a 8,88 unidades: beneficio neto de 3,12. No significa que cada consulta ahorre 3,12. En la rama positiva pagamos 2 y enviamos igualmente a revisión. La ganancia global nace de evitar muchas revisiones en la rama negativa, aceptando las pérdidas residuales del modelo. Si el precio superara 5,12, consultar dejaría de convenir en esta comparación de una sola pregunta. Con ese precio exacto, ambas estrategias empatan.
¿Por qué el valor bruto no es negativo? Porque el agente podría ignorar la señal y mantener su elección inicial. Formalmente, para cualquier acción fija a, el coste mínimo condicionado a la señal no supera el de a en esa rama. Al promediar y elegir como a la acción óptima inicial obtenemos L₁ ≤ L₀. Esto exige que las acciones sigan disponibles, que se pueda ignorar la información y que comprobar no altere directamente el caso. Un servicio que bloquea el expediente, expone datos o consume un plazo no se describe solo por su beneficio informativo.
Saber más puede valer cero
Comparamos A con B, que tiene s = 0,6 y f = 0,4. Con el mismo p inicial, el positivo ocurre con probabilidad 0,44 y eleva la probabilidad de excepción a 3/11, aproximadamente 27,27%; el negativo ocurre con probabilidad 0,56 y la reduce a 1/7, aproximadamente 14,29%. El control distingue algo: ambas probabilidades difieren entre sí y de la inicial. Sin embargo, las dos quedan por encima del 12%. Cualquier respuesta conduce a R y cuesta 12. L₁ sigue siendo 12 y V vale cero.
Aquí separamos reducir incertidumbre de mejorar una decisión. La información mutua mide en bits una reducción media de incertidumbre probabilística; no conoce nuestra tabla de costes. Para B, en el ejemplo, el cálculo da unos 0,01864 bits pero ningún beneficio decisorio. No hace falta dominar la entropía para comprenderlo: el indicio mueve la estimación sin cruzar el umbral operativo. B puede tener valor con otras probabilidades iniciales o costes. No afirmamos que sea inútil universalmente.
Para reconstruir ese número definimos h(x) = −x log₂(x) − (1−x) log₂(1−x), con contribuciones nulas en x = 0 y x = 1. La incertidumbre de la respuesta es h(z); conociendo H quedaría la media p h(s) + (1−p) h(f). Su diferencia I(H;Z) es la información mutua. Para B resulta h(0,44) − h(0,6), pues h(0,4) = h(0,6). Esto muestra que el valor decisorio nulo no procede de haber construido una herramienta completamente independiente del problema.

En el gráfico importa la altura de la curva en el punto que describe el expediente, no solo cuál es la más alta globalmente. Con p = 0,20, A supera la línea de coste y B no. Cerca de los extremos, cuando el estado ya es casi seguro, queda poco por ganar. Cambiar la pérdida por error o el coste de revisión alteraría las curvas. Fiabilidad de la herramienta y situación decisoria actúan juntas: una clasificación única desligada del cometido perdería esa dependencia.
Un límite superior: conocer perfectamente el estado
Antes de diseñar herramientas más caras podemos preguntar cuánto valdría una respuesta perfecta. Conociendo H elegiríamos S para los casos ordinarios y R para las excepciones. El coste restante sería 0,8 × 0 + 0,2 × 12 = 2,4. La información perfecta valdría 12 − 2,4 = 9,6 unidades. No vale 12: conocer la excepción no elimina el coste de revisarla. Ninguna herramienta puramente informativa sobre el mismo estado mejora ese límite con nuestras acciones y costes fijos. Pagar más de 9,6 carecería de sentido incluso antes de examinar su precisión.
Una segunda pregunta: su valor depende de la primera respuesta
Hasta ahora permitíamos una comprobación. Permitamos como máximo dos, ambas con las prestaciones de A y coste 2. Añadimos un supuesto fuerte: las respuestas son independientes condicionadas a H. Una vez fijada la presencia o ausencia de excepción, conocer la primera señal no cambia las probabilidades de la segunda. No implica independencia sin conocer H. Podemos imaginar verificaciones con mecanismos de error separados, pero es una construcción probabilística: dos archivos que copian la misma fuente no la cumplen automáticamente.
Tras un primer positivo partimos de p = 2/3. Aunque la segunda consulta fuera negativa, la probabilidad solo bajaría a 4/13, aproximadamente 30,77%, todavía sobre el umbral. Si fuera positiva subiría más. Ambos resultados conducen a R: el valor bruto del segundo control es cero y paramos. Tras un primer negativo partimos de 1/19. Un segundo positivo lleva a 4/13 y a R; un segundo negativo lleva a 1/82, aproximadamente 1,22%, y a S. En esta rama la consulta sí puede cambiar la acción.
Desarrollamos la rama negativa para no esconder la conveniencia en un algoritmo. Sin segunda consulta gastaríamos 100/19 = 5,26316 unidades en promedio. Con ella, el coste de las acciones siguientes, sin la nueva pregunta, baja a 2,69474; al añadir 2 obtenemos 4,69474. La ganancia condicionada al primer negativo es aproximadamente 0,56842. Esa rama ocurre con probabilidad 0,76, de modo que el ahorro esperado adicional desde el inicio es 0,432. La estrategia completa cuesta 8,88 − 0,432 = 8,448. Las cifras redondeadas explican la cuenta; el programa conserva fracciones exactas.
Podemos escribir la regla para un presupuesto de n preguntas restantes. Wₙ(p) es el coste mínimo alcanzable desde el punto actual; sin consultas queda L₀. Con al menos una pregunta comparamos parar ahora con pagar c y continuar óptimamente tras cada respuesta. La suma sobre señales y incluye + y −, y pᵧ es la probabilidad actualizada. Es una recursión de horizonte finito: resuelve el pequeño modelo especificado, no cualquier planificación de un agente real.
Esto revela un límite de “preguntar solo si la siguiente respuesta compensa por sí sola”. Con varios pasos, una observación puede preparar una comprobación posterior más útil: el criterio debe considerar la continuación, como hace Wₙ. En nuestro caso la primera consulta ya compensa aisladamente, pero no es un principio universal. Enumerar ingenuamente dos respuestas durante h pasos crece como 2ʰ; memorizar estados equivalentes evita recalcular sin eliminar en general la dificultad de planificar.
Repetir la misma respuesta no aporta otra evidencia
Si la segunda llamada devuelve exactamente el mismo dato almacenado que la primera, su resultado ya está determinado condicionado a lo conocido. La probabilidad de excepción no cambia y el valor informativo adicional es cero. Aplicar Bayes otra vez como si fuera una prueba independiente contaría dos veces la misma evidencia. También sucede si se reformula la respuesta. Antes de estimar el valor de otra herramienta, el agente debe distinguir una observación nueva de una nueva presentación de la anterior.
Reproducir el cálculo y entender qué falta
El paquete adjunto calcula las medias con Fraction, la representación racional de Python, y comprueba resultados principales con assert. No hay muestreo aleatorio y no hace falta semilla. El gráfico usa 1.001 valores de p entre cero y uno; la conversión decimal sirve para exportar y visualizar. risk elige el menor coste; branches calcula probabilidades de respuestas y posteriores; voi resta costes esperados; value aplica la recursión. El fragmento final importa funciones de experiment.py: debe ejecutarse en el directorio extraído del archivo, no como programa sin dependencias locales.
La limitación principal no es la aritmética, sino conocer los parámetros. Hacen falta probabilidades fiables para el contexto actual, una tabla coherente de costes y un modelo conjunto de errores al encadenar herramientas. Una probabilidad enunciada con seguridad por un modelo lingüístico no basta. Además, esperar puede costar distinto según el expediente; la revisión puede tener capacidad limitada; el estado puede cambiar durante la búsqueda. Eso exige ampliar el modelo, no seguir aplicando los mismos números atribuyéndoles una precisión que no tienen.
Para trasladar el razonamiento a un proyecto empresarial se podría proponer una evaluación de tres políticas sobre casos separados de los usados para estimar parámetros: ninguna consulta, una consulta fija y consulta adaptativa. Habría que registrar resultados, costes, llamadas y dependencias entre fuentes, distinguiendo calidad probabilística de calidad decisoria. Esa prueba no se ha realizado aquí: no participaron archivos empresariales, lectores ni operadores. El modelo es una hipótesis de aplicación para diseñar y evaluar agentes; no documenta una función ya disponible de EL-AI.
La respuesta a la pregunta inicial
Conviene preguntar cuando la mejora esperada de las decisiones futuras supera el coste total de la petición. En nuestro ejemplo una respuesta útil vale 5,12 unidades antes de su precio; otra menos discriminante vale cero en la misma situación; una segunda comprobación independiente compensa solo tras el primer negativo. No se trata de volver al agente reacio a preguntar, sino de conectar cada pregunta con una elección que podría cambiar y con consecuencias explícitas. Así explicamos por qué continúa o se detiene, en vez de medir su inteligencia por el número de consultas.
Fuentes y naturaleza de la contribución
Referencia conceptual: David L. Poole y Alan K. Mackworth, Artificial Intelligence: Foundations of Computational Agents, tercera edición, 2023, secciones 12.3 y 12.4. Se consultaron el formalismo de decisiones secuenciales, la optimización de políticas y las propiedades del valor informativo. Es un manual, no un nuevo preprint ni un benchmark de agentes. El ejemplo administrativo, parámetros, derivación numérica, gráfico y código se construyeron para esta explicación, sin reproducir los ejemplos del libro. Es una monografía didáctica asistida por IA, no investigación original revisada por pares.
Poole & Mackworth (2023), §12.3 — Sequential Decisions.
Poole & Mackworth (2023), §12.4 — The Value of Information and Control.
from fractions import Fraction as F
from experiment import risk, branches, voi, value, STRONG, WEAK
p = F(1, 5)
print('baseline', float(risk(p)))
for name, tool in [('A', STRONG), ('B', WEAK)]:
print(name, [(float(w), float(q)) for w, q in branches(p, *tool)])
print('gross value', float(voi(p, *tool)))
print('one query', float(value(p, 1)))
print('adaptive two queries', float(value(p, 2)))
Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 9 de octubre de 2026.

