Monografía técnica · Modelos generativos continuos · 21 de septiembre de 2026
Resumen
En flow matching pueden construirse ejemplos de entrenamiento interpolando en línea recta entre ruido y datos. Esta sencillez no implica que el generador siga rectas ni que baste un paso numérico para obtener la distribución deseada. Analizamos el paso de la velocidad condicionada a su media condicional y desarrollamos un caso gaussiano completamente resoluble. El campo exacto transforma N(0,1) en N(3,4), pero un solo paso de Euler colapsa todas las muestras en el punto 3. Comparamos Euler y Heun con un presupuesto declarado de evaluaciones del campo y separamos error de aprendizaje, trayectoria probabilística e integración. El resultado muestra de forma verificable cómo un generador puede tener el campo correcto y producir una distribución equivocada.
Requisitos y contribución. Se necesitan derivadas, probabilidad condicional y nociones de distribución gaussiana. Es una derivación didáctica con cálculos ejecutados, no un nuevo método generativo ni la reproducción de una evaluación sobre imágenes. No entrenamos una red: conocemos el campo exacto y estudiamos únicamente el transporte y su muestreo numérico.
1. ¿Qué se aprende y qué se integra?
Un modelo generativo continuo parte de una variable sencilla X₀, por ejemplo ruido gaussiano, y la transforma en una variable cuya distribución se parece a los datos. El tiempo t pertenece a [0,1] y no representa el tiempo físico de la escena. Un campo v(t,x) asigna una velocidad a cada posición x. La muestra generada es el extremo de una trayectoria que satisface dX/dt = v(t,X).
Esta descripción ya contiene dos objetos distintos: la distribución de las muestras en cada instante y el recorrido de cada muestra. Una distribución puede transportarse mediante campos diferentes. Especificar adónde debe llegar la masa de probabilidad no determina por sí solo todas las trayectorias. En varias dimensiones pueden existir movimientos que modifican los recorridos sin cambiar una densidad determinada.
El trabajo fundacional de flow matching formula el aprendizaje como regresión de un campo de velocidades y permite construir objetivos condicionados tratables. Aquí profundizamos en la distinción entre campos condicionados y marginales, explícita en el método original. Nuestro análisis desarrolla un caso escalar elegido para poder calcular todos sus pasos. [1, secciones 3–4]
Conviene evitar un atajo terminológico: «entrenamiento sin simulación» significa que construir el ejemplo de entrenamiento no requiere integrar la EDO del modelo. No significa que la generación carezca de integración. Para obtener una muestra nueva todavía hay que resolver, exactamente o de forma aproximada, un problema dinámico.
2. De las parejas de muestras a la regresión de velocidad
Elegimos X₀ de la distribución inicial y X₁ de la distribución objetivo. Por ahora, las muestreamos independientemente. Definimos una interpolación y su derivada:
L(θ) = E[‖vθ(t,Xt)−U‖²]. (1)
El tiempo se muestrea uniformemente. El objetivo U está disponible porque conocemos ambos extremos de la pareja. La red, en cambio, solo recibe t y Xt, no los extremos ocultos. Parejas distintas pueden producir la misma posición intermedia con velocidades diferentes. Reconstruir exactamente cada velocidad individual puede resultar imposible incluso con capacidad ilimitada.
El minimizador de la pérdida cuadrática es la media condicional. Con tiempo y posición fijados, escribimos U = E[U|Xt] + R, donde el residuo R tiene media condicional cero. Al desarrollar el cuadrado, el término cruzado desaparece. Obtenemos:
E[‖v−U‖²] = E[‖v−v*‖²] + E[‖U−v*‖²]. (2)
El segundo término no depende de los parámetros de la red. Por tanto, una pérdida de entrenamiento positiva puede ser compatible con un campo marginal perfecto. Comparar valores absolutos de pérdida entre trayectorias distintas, ignorando esta componente irreducible, puede llevar a conclusiones equivocadas sobre la calidad de los modelos.
¿Por qué la media condicional transporta la distribución correcta? Tomemos una función de prueba regular f. La regla de la cadena da dE[f(Xt)]/dt = E[∇f(Xt)·U]. Condicionando sobre Xt, podemos sustituir U por v*. Esta es la forma débil de la ecuación de continuidad asociada al campo marginal. El argumento exige regularidad e integrabilidad suficientes para intercambiar derivada y esperanza; la fórmula de regresión por sí sola no permite ignorar esas hipótesis.
3. Un caso gaussiano que podemos resolver exactamente
Consideremos X₀ ∼ N(0,1) y X₁ ∼ N(μ,σ²), independientes. La interpolación también es gaussiana. Su media es m(t) = tμ y su varianza D(t) = (1−t)² + t²σ². Para la velocidad U tenemos E[U] = μ y Cov(U,Xt) = tσ²−(1−t).
La media condicional de dos variables conjuntamente gaussianas es afín. Sustituyendo las cantidades recién calculadas obtenemos:
v*(t,x) = μ + [c(t)/D(t)](x−tμ). (3)
Para σ > 0, el denominador permanece positivo en todo el intervalo. El campo marginal de este ejemplo no tiene singularidades en los extremos. La dependencia respecto a x es lineal, pero su coeficiente depende del tiempo. «Campo lineal en el estado» y «trayectoria rectilínea en el tiempo» son propiedades diferentes.
La solución de la EDO que parte del valor z es explícita:
φ(0,z)=z, φ(1,z)=μ+σz. (4)
Para verificarla observamos que D′(t)=2c(t). La derivada de la solución es μ + c(t)z/√D(t). Evaluando (3) en x=φ(t,z) obtenemos la misma expresión. Si z es normal estándar, la solución tiene exactamente media tμ y varianza D(t). Hemos comprobado tanto la dinámica como la distribución, sin depender del aspecto de una nube de puntos.
El cálculo utiliza μ=3 y σ=2. La varianza disminuye inicialmente: D(t)=1−2t+5t² alcanza un mínimo de 0,8 en t=0,2 y después crece hasta 4. El flujo primero contrae y después expande. Para z distinto de cero, la raíz de D(t) hace que la trayectoria no sea afín en el tiempo, aunque se construya a partir de interpolaciones condicionadas rectilíneas.
4. Las rectas de las parejas no son las trayectorias del generador
La recta (1−t)x₀+tx₁ conserva la identidad de una pareja inicial. El campo marginal, en cambio, agrega las velocidades compatibles con la posición actual. En general, sus trayectorias no conservan el emparejamiento original entre x₀ y x₁. En nuestro ejemplo, la EDO termina siempre en μ+σx₀, mientras que la pareja de entrenamiento utilizaba un x₁ independiente de x₀.
No hay contradicción: ambas construcciones tienen las mismas distribuciones marginales intermedias, pero dependencias distintas entre los extremos. Un generador debe producir la distribución final; no está obligado a reproducir el acoplamiento aleatorio usado para construir los objetivos. Confundir distribución y acoplamiento hace parecer misteriosa una operación sencilla de condicionamiento.
También podemos cambiar el acoplamiento. Si elegimos X₁=μ+σX₀ en lugar de muestrearlo independientemente, la interpolación pasa a ser Xt=tμ+[1+t(σ−1)]X₀. Ahora todas las trayectorias son rectilíneas, la varianza intermedia es [1+t(σ−1)]² y la velocidad condicionada no es ambigua dado Xt. Los extremos conservan las mismas distribuciones; cambia el camino entre ellos.
Esta comparación aclara el papel de la elección de parejas. En la práctica no solemos disponer del mapa de transporte exacto entre ruido y datos complejos. La facilidad del caso gaussiano no se traslada automáticamente a las imágenes. Pero basta para demostrar que la distribución objetivo, por sí sola, no determina la dificultad de la regresión o del muestreo.
5. Una pérdida positiva incluso con un campo perfecto
Con acoplamiento independiente, la varianza condicional de la velocidad es constante respecto a la posición, pero varía con el tiempo. La fórmula gaussiana proporciona:
Con σ=2 vale 4 al inicio, 5 en el mínimo de D y 1 al final. Estas cantidades no son errores de la red: describen la ambigüedad de los objetivos creada por el acoplamiento independiente. La identidad final se comprueba desarrollando (1+σ²)D−c², que se reduce a σ². La comparación con el acoplamiento determinista, donde esta varianza es cero, deja claro por qué la pérdida no es una métrica universal comparable sin contexto.
La red puede aprender una media útil a partir de objetivos ruidosos. La ecuación (2) explica el motivo: minimizar la pérdida condicionada reduce la desviación respecto al campo marginal, aunque permanezca una componente irreducible. Es un fenómeno de regresión estadística; no requiere que cada ejemplo de entrenamiento pueda reconstruirse exactamente.
6. Experimento ejecutado: un paso puede destruir la distribución
Integramos el campo exacto (3) con Euler explícito y Heun, utilizando pasos uniformes. Euler emplea una evaluación del campo por paso y Heun dos. Si h=1/n, las reglas respectivas son:
Heun: k₁=v(tj,xj), k₂=v(tj+h,xj+hk₁)
xj+1 = xj + h(k₁+k₂)/2. (6)
Para n=1, Euler evalúa v(0,z)=3−z. La salida es z+(3−z)=3 para cualquier z. El ruido desaparece y obtenemos una masa puntual, aunque el objetivo sea N(3,4). La media es correcta, pero la varianza es cero. Una comprobación limitada a la media declararía exitoso un muestreador completamente equivocado.
Como el campo y los integradores son afines en el estado, la salida numérica sigue siendo una transformación afín de z. Para determinar exactamente su media y desviación estándar basta integrar z=0 y z=1; no hace falta muestreo Monte Carlo. Medimos la distancia Wasserstein de orden 2 entre gaussianas unidimensionales: W₂²=(m−3)²+(s−2)², donde m y s son la media y desviación estándar numéricas. La fórmula incluye el caso degenerado s=0.
| Método | Pasos | Evaluaciones NFE | Desviación estándar | W₂ |
|---|---|---|---|---|
| Euler | 1 | 1 | 0,000000 | 2,000000 |
| Euler | 4 | 4 | 1,362162 | 0,637838 |
| Heun | 2 | 4 | 1,530000 | 0,470000 |
| Euler | 16 | 16 | 1,822732 | 0,177268 |
| Heun | 8 | 16 | 1,980850 | 0,019150 |
| Euler | 64 | 64 | 1,954221 | 0,045779 |
| Heun | 32 | 64 | 1,999010 | 0,000990 |

El cálculo se ejecutó con Python 3.14.0 y únicamente su biblioteca estándar. No necesita semilla porque las operaciones son deterministas. La comprobación por diferencias finitas de la derivada de la solución exacta devolvió una discrepancia máxima aproximada de 6,07×10⁻¹⁰. Los resultados completos incluyen cantidades intermedias de pasos y se adjuntan al código.
Con 16 evaluaciones, Heun reduce el error a aproximadamente 0,01915 frente a 0,17727 de Euler. Es un resultado de este problema regular, no una garantía de que Heun siempre sea más eficiente en generadores neuronales. Aquí el coste del campo es trivial; en un modelo real importan el tamaño del lote, la precisión, la arquitectura, la memoria y el coste de cada evaluación. NFE es una medida estructural útil, no un cronómetro.
7. Separar tres errores antes de elegir un generador
El primer error es estadístico: los datos finitos y la capacidad del modelo pueden impedir aprender v*. El segundo afecta al objetivo y a la trayectoria: la distribución final definida por la construcción puede ser una versión regularizada de los datos, o el acoplamiento puede dificultar el campo. El tercero es numérico: incluso un campo perfecto produce muestras incorrectas si el solucionador es demasiado grueso. Nuestro experimento elimina el primero y aísla el tercero.
Una pérdida menor no identifica por sí sola qué error ha disminuido. Más pasos no corrigen sistemáticamente un campo equivocado; integran con mayor exactitud la dinámica equivocada. A la inversa, entrenar una red mejor puede dar beneficios invisibles si el muestreador domina el error final. Por eso deben variarse por separado el modelo, la trayectoria y la integración.
Una comparación informativa fija primero el campo y estudia la convergencia numérica; después fija un solucionador suficientemente preciso y compara campos aprendidos. En imágenes, distribución y calidad no se reducen a media y varianza; nuestro W₂ analítico no sustituye métricas y evaluaciones apropiadas para el dominio. La ventaja didáctica consiste precisamente en disponer de una verdad exacta con la que comprobar cada paso.
Las notas del MIT de 2025 desarrollan la relación entre trayectorias probabilísticas, campos marginales y aprendizaje, y ofrecen una referencia para ampliar este análisis. No comparamos arquitecturas generativas recientes ni declaramos un ganador del estado del arte: estudiamos un mecanismo necesario para interpretarlas. [2, secciones 2–4]
8. Materiales reproducibles y conclusión
El programa adjunto implementa D(t), el campo, la solución exacta y ambos integradores. Se ejecuta con python experiment.py --out results.json. El script de gráficos requiere Matplotlib; las instrucciones y versiones están en el archivo. No se necesitan pesos de modelos, conjuntos de datos ni servicios externos.
def variance(t):
return (1-t)**2 + 4*t*t
def velocity(t, x):
return 3 + (-1+5*t)/variance(t) * (x-3*t)
def exact(t, z):
return 3*t + math.sqrt(variance(t))*z
Descargar código, resultados e instrucciones · Resultados numéricos en JSON.
La conclusión es precisa: hacer rectilíneos los ejemplos condicionados no basta para hacer rectilíneo el flujo marginal. El modelo aprende una media condicional y el generador integra ese campo. Distribución intermedia, acoplamiento de parejas, ambigüedad de regresión y precisión numérica son niveles distintos. En nuestro caso el campo es exacto y la media final correcta, pero un único paso destruye toda la variabilidad deseada. Comprobar estas hipótesis, más allá de la aparente sencillez de la interpolación, permite razonar rigurosamente sobre modelos generativos.
Referencias
- Lipman, Y., Chen, R. T. Q., Ben-Hamu, H., Nickel, M., Le, M. Flow Matching for Generative Modeling. arXiv:2210.02747v2, 2023. Métodos: secciones 3–4; protocolo experimental: sección 6.
- Holderrieth, P., Erives, E. An Introduction to Flow Matching and Diffusion Models. Notas MIT 6.S184, arXiv:2506.02070v1, 2025. Trayectorias, campos y regresión: secciones 2–4.
Análisis preparado con asistencia de IA. Experimento didáctico sintético, no investigación empresarial de EL-AI. Portada ilustrativa generada con IA; la figura científica procede de los cálculos adjuntos.

