Ocho solicitudes por segundo para un servidor capaz de diez
Un servicio tarda de media 100 milisegundos por solicitud: podría completar diez por segundo sin pausas. Llegan ocho, ¿por qué se espera mucho más de 100 milisegundos? La capacidad media ignora momentos de llegada y variación de duraciones. Tres solicitudes próximas forman cola aunque después haya inactividad. El tiempo libre futuro no puede procesar una solicitud antes de llegar.
Resumen. Estudiamos un servidor que procesa de uno en uno por orden de llegada. Separamos servicio, espera y respuesta; derivamos M/G/1 y comparamos tres distribuciones con igual media. La respuesta media es 300, 500 o 750 ms sin cambiar llegadas ni servicio medio de 100 ms. Una simulación verifica magnitud y variabilidad estadística. No es prueba de carga EL-AI ni predicción de GPU con batching dinámico.
Primero la secuencia, después el modelo
Cuatro solicitudes llegan a 0, 40, 80 y 500 ms y requieren 100 ms cada una. La primera empieza de inmediato; la segunda a 100 ms tras esperar 60; la tercera a 200 tras esperar 120; la cuarta a 500 sin espera. El procesamiento es constante, pero las respuestas tardan 100, 160, 220 y 100 ms. No hace falta ralentizar el modelo para empeorar el servicio percibido.
S es tiempo de servicio, W espera previa y T tiempo total en el sistema. La primera relación gobierna simulador: empezar tras llegada y final anterior. Excluimos red, autenticación y preprocesamiento externo; si existen, deben medirse y añadirse coherentemente. La palabra latencia no identifica por sí sola el intervalo.
Hipótesis que hacen resoluble la cola
M/G/1 supone llegadas Poisson a tasa λ solicitudes por segundo: intervalos exponenciales independientes, no espaciado regular. G indica servicio de distribución general, independiente e idénticamente distribuido e independiente de llegadas. Uno significa un servidor. Cola ilimitada, sin abandono, prioridades ni interrupción; orden FIFO, primero en llegar, primero en salir.
Sea m=E[S] servicio medio y ρ=λm carga sin unidades. λ=8 y m=0,1 s dan ρ=0,8. Estacionariedad estable requiere ρ<1; espera media finita requiere además E[S²] finito. Estabilidad significa no crecer indefinidamente a largo plazo, no cumplir cada plazo. El 80% es carga del servidor ideal, no lectura automática de utilización GPU.
Por qué aparece el cuadrado de la duración
Al llegar puede haber una solicitud en servicio y otras esperando. Se espera el servicio residual R y los servicios completos anteriores. Un trabajo largo también es más probable de encontrar aún activo. La media no basta. Durante un servicio de s segundos, el residual baja linealmente de s a cero y su área es s²/2. Las duraciones largas pesan cuadráticamente en el residual temporal.
N_q cuenta solicitudes esperando, excluida la atendida. La tercera línea usa relación de Little entre número medio, flujo y espera. Llegadas Poisson ven promedios temporales, propiedad PASTA, que conecta observación al llegar con promedio temporal. Sustituyendo y agrupando E[W] obtenemos Pollaczek–Khinchin. λ tiene s⁻¹ y E[S²] s²: resulta segundos.
Misma media, tres esperas distintas
Primero, servicio constante de 0,1 s: E[S²]=0,01 s². Segundo, duración exponencial con media 0,1 s y segundo momento 0,02 s². Tercero, nueve de diez duran 0,05 s y una 0,55 s independientemente. Media 0,9·0,05+0,1·0,55=0,1 s; segundo momento 0,9·0,05²+0,1·0,55²=0,0325 s². Son alternativas sintéticas para aislar variabilidad, no registros empresariales.
| Distribución | E[S] (ms) | E[W] (ms) | E[T] (ms) |
|---|---|---|---|
| S = 0.1 s | 100 | 200 | 300 |
| S ~ Exp(mean=0.1 s) | 100 | 400 | 500 |
| P(S=0.05 s)=0.9; P(S=0.55 s)=0.1 | 100 | 650 | 750 |
Para la mezcla, espera 8·0,0325/[2·(1−0,8)]=0,65 s más 0,1 s de servicio. El servidor trabaja igual fracción media en los tres casos. Cambia el retraso que un trabajo largo impone detrás. C_s²=Var(S)/m², coeficiente de variación al cuadrado, vale 0, 1 y 2,25. Como E[S²]=m²(1+C_s²), la espera es ρm(1+C_s²)/[2(1−ρ)].
Cerca del límite, pequeños cambios cuestan más
El denominador 1−ρ es margen restante. Con servicio exponencial medio 100 ms, pasar de 8 a 9 llegadas por segundo lleva respuesta de 0,5 a 1 s: 12,5% más tráfico la duplica. Con 9,5, son 2 s. No hay umbral mágico universal del 80%; depende de distribuciones, objetivos y arquitectura. Definir respuesta aceptable y validar modelo precede a elegir reserva.

Acelerar cálculo afecta no linealmente. En caso exponencial, bajar servicio de 100 a 80 ms con ocho llegadas por segundo reduce ρ de 0,8 a 0,64 y respuesta de 500 a unos 222 ms. Es cambio de parámetro bajo hipótesis fijas, no promesa de hardware. Añadir segundo servidor cambia modelo; no basta sustituir m por m/2. Importan balanceo y cola compartida.
Una simulación que muestra su incertidumbre
Ejecutamos ocho simulaciones independientes por distribución. Cada una inicia vacía, descarta 20.000 llegadas de calentamiento y conserva 300.000. Intervalos exponenciales de media 1/8 s y recurrencia inicial. NumPy 2.5.3 genera 24 flujos mediante SeedSequence(20260929).spawn(24), orden constante, exponencial, mezcla. Esperas promediadas: 199,0, 403,7 y 658,0 ms frente a 200, 400 y 650 teóricos.
Los errores estándar de ocho medias independientes son unos 1,0, 4,7 y 6,1 ms. Solicitudes consecutivas dependen: una acumulación afecta muchas posteriores. Tratarlas como independientes subestima incertidumbre. Las réplicas muestran el límite, pero ocho no prueban comportamiento asintótico ni eliminan todo efecto del calentamiento. La fórmula es analítica bajo hipótesis; simulación, comprobación finita con desviaciones declaradas.
Dónde deja de describir la inferencia
Motores reales pueden agrupar solicitudes. El batching hace depender servicio de la cola y rompe independencia. Longitudes de salida, cancelaciones, caché y acelerador compartido añaden dependencias. Las llegadas pueden ser ráfagas. Una cola finita rechaza solicitudes: baja latencia entre aceptadas puede ocultar un servicio en dificultades.
Aplicar exige tiempos de llegada, inicio y fin, clase, resultado y política. Verificar distribuciones de intervalos, variabilidad y correlaciones; comparar con pruebas fuera de datos de estimación. No se hizo en EL-AI. La fórmula media no determina percentiles 95 o 99: iguales media y varianza admiten colas distintas. Objetivos de percentil requieren medidas o modelo adicional.
Capacidad disponible no garantiza respuesta
Se ralentiza antes de saturar porque absorbe irregularidad temporal, no solo trabajo medio. El margen vacía acumulaciones; la variabilidad determina frecuencia y duración. Con ocho solicitudes por segundo, reducir variabilidad cambia espera sin alterar cálculo medio. Diseñar exige medir servicio y cola por separado y elegir margen frente a objetivo verificable, sin usar máxima utilización como única eficiencia.
Referencia y reproducibilidad
Eytan Modiano, MIT — M/G/1 Queues, Lectures 8–9, course 6.263J, Fall 2002, slides 2–6.
La referencia presenta hipótesis, fórmula y demostración por servicio residual. Números de IA, mezcla y simulaciones son ejemplos didácticos ejecutados aquí. El fragmento reproduce comparación analítica; archivo incluye simulador, resultados por réplica y figuras. No son reproducción de benchmark de autores ni investigación original revisada por pares.
mean_service = 0.1 # seconds
arrival_rate = 8.0 # requests per second
rho = arrival_rate * mean_service
for name, second_moment in [('constant', .01), ('exponential', .02), ('mixture', .0325)]:
waiting = arrival_rate * second_moment / (2 * (1-rho))
print(name, 'queue seconds:', waiting, 'total seconds:', waiting+mean_service)
# Analytical M/G/1 values, not a real inference benchmark.
Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 29 de septiembre de 2026.

