La paradoja de los recursos libres
Imaginemos un asistente que lee muchos documentos técnicos. El modelo tiene varios módulos especializados y usa solo uno por fragmento de texto. Parece una forma natural de ahorrar cálculo. Sin embargo, una parte se llena mientras otras quedan casi vacías. El total de recursos no explica el problema: importa dónde llegan las solicitudes. ¿Cómo puede activarse poco cálculo en conjunto y sobrecargarse un destino concreto?
Resumen. Estudiamos una capa Mixture of Experts, MoE, que selecciona un experto por token. Un ejemplo sintético de dieciséis tokens permite deducir capacidad, asignaciones no procesadas y espacio libre. Separamos probabilidades del router, decisiones discretas, equilibrio temporal y distribución física. Comparamos Switch con avances documentados en DeepSeek-V3 y el preprint LLEP de 2026, sin trasladar sus benchmarks al ejemplo. Nuestros resultados son conteos Python ejecutados, sin entrenar redes ni medir GPU.
Un experto no es una persona; un token no es una solicitud
Un token es una unidad de segmentación: palabra, fragmento o signo. Aquí un experto es una red feed-forward, un bloque de transformaciones numéricas sobre la representación del token. Los expertos tienen parámetros distintos; no son agentes que debaten ni corresponden necesariamente a profesiones. El nombre alude a una posible especialización aprendida, no a una competencia certificada.
El router puntúa los módulos y decide cuáles usar. Top-1 elige el mayor valor; top-k selecciona k. La dispersión se refiere a expertos activos por token, no a todo el modelo: atención, router y otros componentes siguen trabajando. Dieciséis tokens pueden proceder de una conversación o varios documentos; no equivalen a dieciséis usuarios atendidos.
Construimos un caso controlable
Tomamos T=16 tokens y E=4 expertos. Doce prefieren el experto 1, dos el 2 y uno cada uno los expertos 3 y 4: n=[12,2,1,1]. n_i cuenta asignaciones al experto i y suma dieciséis porque cada token se asigna una vez. Es un lote inventado, no una traza comercial. La carga media es cuatro y la máxima doce, tres veces la media.
Procesar todas las asignaciones depende de la capacidad local C. Suponemos buffers rígidos iguales: cada experto admite como máximo C asignaciones en ese paso. El exceso no pasa automáticamente a otro experto. Cuatro ventanillas ayudan a imaginar la cola, pero la analogía tiene un límite: los pesos difieren y cambiar de módulo puede cambiar la función calculada.
Por qué dieciséis posiciones no bastan
Definimos c como factor de capacidad, multiplicador sin unidades de la carga media. Redondeamos hacia arriba: C=ceil(cT/E). Con c=1, C=4 y EC=16. Capacidad total y demanda coinciden, pero no su distribución: el primer experto admite cuatro de doce y los demás 2, 1 y 1. Se procesan ocho asignaciones y otras ocho exceden el límite.
A cuenta asignaciones procesadas, D las excedentes y U posiciones libres. Son conteos, no segundos, vatios ni bytes. La segunda fórmula suma lo que admite cada experto, no una capacidad hipotética intercambiable. Con c=1, A=8, D=8 y U=8: coexisten demanda sin atender y espacio libre. Es la explicación cuantitativa de la paradoja inicial.
| c | C por experto | D excedentes | Posiciones totales | U libres |
|---|---|---|---|---|
| 1 | 4 | 8 | 16 | 8 |
| 1.25 | 5 | 7 | 20 | 11 |
| 1.5 | 6 | 6 | 24 | 14 |
| 2 | 8 | 4 | 32 | 20 |
| 2.5 | 10 | 2 | 40 | 26 |
| 3 | 12 | 0 | 48 | 32 |
La tabla varía c sin cambiar el routing. Duplicar capacidad da C=8, pero deja cuatro excesos. Para eliminarlos hace falta C=12, con c=3: cuarenta y ocho posiciones para dieciséis asignaciones. Eso no implica triple memoria o tiempo real; dependen de buffers y kernels. Es un conteo de asignación rígida, no una medición de acelerador.

Descartar un token no significa borrar una palabra
En una capa MoE, token dropping puede significar omitir la contribución experta por falta de capacidad. En Switch, la representación continúa por la conexión residual; no se borra una palabra del documento. El modelo puede responder, pero ese token no recibió la transformación prevista en esa capa. Contamos contribuciones ausentes, sin calcular el efecto sobre la calidad lingüística.
Otras implementaciones procesan todo con formas dinámicas, agrupación o planificación diferente. Entonces D no describe el runtime: cuenta lo que excedería un C hipotético. El problema puede reaparecer como memoria, espera o trabajo en el dispositivo más cargado. Interpretar un porcentaje de descarte exige conocer la política; cargas iguales pueden tener consecuencias distintas.
Probabilidades casi uniformes, decisiones desiguales
Damos a cada token probabilidad 0,28 para su ganador y 0,24 para los demás: suman uno. La preferencia es débil, pero top-1 elige un ganador, no divide el token. f_i=n_i/T es la fracción real de asignaciones y P_i la probabilidad media. Aquí f=[0,75;0,125;0,0625;0,0625], pero P=[0,27;0,245;0,2425;0,2425]. Confundirlas oculta la sobrecarga.
B es un término de equilibrio tipo Switch antes de ponderarlo en el objetivo. Distribuciones uniformes dan uno. Aquí B=1,05375 aunque la mitad excede C=4. No implica que el término sea inútil: no cuenta tokens ausentes ni impone una restricción rígida por lote. Tampoco afirmamos que uno sea una cota inferior global para toda pareja admisible f, P.
El router aprende puntuaciones continuas, pero el ganador cambia discretamente. Regularización y garantía de capacidad responden a preguntas distintas: una orienta el aprendizaje, otra especifica el tratamiento de cada asignación. Aumentar arbitrariamente su peso puede desplazar el objetivo desde calidad hacia uniformidad. Harían falta entrenamientos controlados que aquí no realizamos.
La media diaria puede ocultar cada pico
Cambiamos a cuatro ventanas sucesivas de ocho tokens, todos al experto 1, luego al 2, al 3 y al 4. En conjunto cada experto recibe ocho y el histograma parece equilibrado. Pero con c=1 cada ventana tiene C=8/4=2: sobran seis cada vez, veinticuatro de treinta y dos. El equilibrio agregado no revela el pico relevante para el buffer.
No demuestra que ventanas cortas sean siempre peores ni que cada documento deba usar todos los expertos. Demuestra pérdida de información por agregación. Hay que registrar cargas por capa, lote y dispositivo en la escala del límite. Si la memoria se asigna por micro-lote, la media diaria responde a otra pregunta que el agotamiento instantáneo.
Equilibrar expertos y máquinas es distinto
El experto es lógico y la GPU física, pudiendo alojar varios. Ocho expertos con cargas [8,8,0,0,4,4,4,4], repartidos por parejas consecutivas, dan [16,0,8,8] en cuatro dispositivos. Las parejas (1,3), (2,4), (5,6), (7,8) dan [8,8,8,8]. Ningún token cambia de experto: cambia dónde se ejecuta.
Es una posibilidad de reparto, no una aceleración medida. Mover o replicar pesos cuesta memoria y comunicación; resultados y gradientes deben regresar y acumularse correctamente. El siguiente lote puede cambiar. El equilibrio físico conserva la elección semántica pero añade planificación. Los parámetros activos por sí solos no determinan latencia, memoria máxima ni coste del servicio.
Qué aporta la investigación y qué no reproducimos
Switch Transformers, de Fedus, Zoph y Shazeer, es de JMLR 2022, no una novedad de 2026. Leímos routing, capacidad, objetivo y experimentos; la tabla 1 usa C4 y 32 núcleos TPUv3. Sus tiempos no describen nuestros conteos ni infraestructura EL-AI.
El informe DeepSeek-V3 v2, del 18 de febrero de 2025, separa sesgo de selección y pesos de combinación, conservando un pequeño término auxiliar por secuencia. Las ablation de dos escalas mantienen datos y arquitectura comparables. No las reproducimos; «loss-free» no significa ausencia de toda pérdida auxiliar.
Para conectar con avances recientes leímos métodos y experimentos de Least-Loaded Expert Parallelism, Nguyen y colegas, arXiv v1 del 23 de enero de 2026. Redistribuye trabajo y pesos; prueba con ocho H200 y distingue capas de modelos completos. El beneficio depende de comunicación, lote y umbrales; no es una revisión exhaustiva.
Del conteo reproducible a la decisión de diseño
El fragmento Python repite la tabla: ceil redondea, min limita admisiones y las restas calculan excesos y posiciones libres. El paquete añade probabilidades, equilibrio, ventanas y distribución. Los datos son deterministas, sin semilla ni generación con modelos. Contar probabilidades cuesta O(TE) y almacena una matriz T×E; solo capacidades cuesta O(E) por configuración. Describe el script, no un kernel MoE.
Una evaluación real fijaría checkpoint, capa, top-k, precisión, hardware, runtime, lote y documentos. Mediría cargas por experto y dispositivo, pico de memoria, comunicación y latencia, además de calidad y dominios infrecuentes. Compararía entradas idénticas incluyendo el coste de equilibrar. Son pruebas propuestas, no realizadas: el ejemplo ayuda a plantearlas antes de medir.
La respuesta es concreta: activar pocos expertos limita parte del trabajo, sin garantizar que llegue donde hay capacidad. Dieciséis posiciones dejan ocho asignaciones sin contribución experta; probabilidades casi uniformes y medias globales no bastan. Capacidad, aprendizaje del routing y distribución física son mecanismos distintos. La empresa debe preguntar qué carga generan sus documentos, con qué calidad y restricciones, además de cuántos parámetros se activan.
Bibliografía y material reproducible
Fedus, Zoph, Shazeer — Switch Transformers, JMLR 23, 2022, sections 2.1–2.4.
from math import ceil
loads = [12, 2, 1, 1]
tokens, experts = sum(loads), len(loads)
for factor in (1, 1.25, 1.5, 2, 2.5, 3):
capacity = ceil(factor * tokens / experts)
accepted = sum(min(n, capacity) for n in loads)
print(factor, capacity, tokens-accepted, experts*capacity-accepted)
Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 4 de octubre de 2026.

