1 Planteamiento
El objetivo del sistema es estimar, para cada partido futuro, una distribución de probabilidad sobre sus tres resultados posibles —victoria local, empate, victoria visitante— a partir del historial de resultados de las competiciones involucradas. No se busca predecir el marcador exacto, sino caracterizar la incertidumbre del encuentro.
El problema pertenece a una clase familiar: la identificación de parámetros de un sistema dinámico a partir de observaciones ruidosas. Un equipo posee una fuerza latente no observable; solo se registran sus salidas (goles a favor y en contra) frente a rivales cuya fuerza también es desconocida. La tarea consiste en recuperar los parámetros latentes desacoplando la contribución propia de la del adversario.
Esta clase de problema fue el objeto del trabajo de tesis del autor sobre parametrización de redes de regulación génica. La correspondencia estructural entre ambos dominios es directa:
Redes de regulación génica
- Sistema dinámico con parámetros latentes
- Solo se observa la salida (expresión)
- Se infiere la estructura de regulación
- Datos escasos y con ruido
- La cinética del sistema restringe el modelo
Sistema de equipos de fútbol
- Sistema con parámetros de fuerza latentes
- Solo se observa la salida (los goles)
- Se infiere ataque, defensa y estilo
- Partidos escasos y con ruido
- El proceso de Poisson restringe el modelo
La metodología empleada aquí traslada el aparato de aquel trabajo —estimación de parámetros restringida por la física del sistema, resuelta por optimización basada en gradiente— al pronóstico deportivo.
2 Principio de diseño: la física como arquitectura
El criterio central de diseño es evitar una arquitectura agnóstica al dominio. En una red densa convencional, las capas y activaciones son arbitrarias y el aprendizaje debe aproximar la función completa desde cero. En el modelo aquí descrito, la forma funcional la impone el proceso físico: cada término tiene una interpretación explícita (ataque, defensa, ventaja de localía, estilo, sesgo de liga), y el aprendizaje se limita a estimar sus coeficientes.
Esto sitúa al modelo dentro del marco de las redes neuronales informadas por física (PINN; Raissi et al., 2019). La distinción respecto a la formulación clásica se precisa en la Sección 6.
3 Parametrización
El modelo mantiene, por equipo y por liga, un conjunto de parámetros ajustables por descenso de gradiente. El total asciende a aproximadamente 11,000 parámetros.
| Símbolo | Dominio | Significado |
|---|---|---|
| αi | ℝ | Capacidad ofensiva del equipo i |
| βi | ℝ | Capacidad defensiva del equipo i |
| hi | ℝ | Ventaja de localía específica por equipo |
| γL | ℝ | Sesgo goleador de la liga L |
| sati, sdefi | ℝ⁴ | Vectores latentes de estilo ofensivo y defensivo |
| μ, r | ℝ | Media global de gol (log) y tasa de decaimiento temporal |
4 Sistema acoplado de intensidades
Para un partido entre el equipo local i y el visitante j en la liga L, las tasas de gol esperadas λ se definen en escala logarítmica como una suma de términos interpretables:
El sistema es acoplado: el parámetro defensivo del local, βi, aparece en la intensidad del visitante, de modo que ambos conjuntos de parámetros se estiman conjuntamente. La formulación es equivalente a un modelo de efectos mixtos aditivos en escala logarítmica, emparentado con los sistemas Elo y Bradley–Terry.
Término bilineal de estilo
El producto interno sati · sdefj modela efectos de emparejamiento (matchup): la interacción sistemática entre el estilo ofensivo de un equipo y el estilo defensivo de su rival, no capturada por las fuerzas escalares. Su ventaja computacional es central: una parametrización explícita por par de equipos escalaría como O(N²), intratable con los volúmenes de datos disponibles por par. La factorización en vectores de dimensión k = 4 reduce la complejidad a O(N·k), y el efecto de emparejamiento emerge de la geometría del espacio latente.
5 Distribución de marcadores
Bajo el supuesto de independencia condicional de Poisson, la probabilidad de un marcador exacto (gh, ga) es el producto de dos distribuciones de Poisson con parámetros λh y λa:
Se evalúa una matriz de marcadores M ∈ ℝ9×9 (marcadores de 0 a 8 por equipo). Las probabilidades de los tres resultados se obtienen sumando sus regiones:
La evaluación de la verosimilitud de Poisson se realiza dentro del grafo de diferenciación automática, de forma que el gradiente de la función de pérdida se propaga a través de ella hasta los parámetros de equipo. No existe una capa densa que aproxime el proceso generador: el proceso se computa de forma exacta y la optimización opera a través de él.
6 Función de pérdida y decaimiento temporal aprendido
El modelo se entrena minimizando la entropía cruzada ponderada temporalmente. Cada partido histórico t, con resultado observado yt, contribuye con un peso decreciente en su antigüedad dt:
La tasa de decaimiento r no se fija a priori: es un parámetro aprendible, reparametrizado mediante softplus para garantizar su positividad,
El modelo estima así, a partir de los datos, la escala temporal relevante del historial. El valor obtenido tras el entrenamiento corresponde a una vida media de aproximadamente 119 días: un partido de esa antigüedad contribuye a la estimación con la mitad del peso de uno reciente.
Optimización
La estimación se realiza con el optimizador Adam bajo un protocolo walk-forward (cada partido emplea únicamente historial anterior a su fecha). La tasa de aprendizaje η y el coeficiente de regularización L2 λwd se determinan por optimización bayesiana de hiperparámetros (Optuna). La regla de actualización es la de Adam con decaimiento de pesos:
| Grupo de parámetros | Por equipo |
|---|---|
| α, β, h | 3 |
| sat, sdef (2k) | 8 |
| γL (por liga) | 1 / liga |
| μ, r (globales) | 2 total |
| Escala total | ≈ 11,000 |
7 Clasificación como PINN
En la formulación clásica (Raissi et al., 2019), una PINN incorpora la física como restricción en la función de pérdida: el residuo de una ecuación diferencial penaliza las soluciones que violan la ley física, sobre una arquitectura por lo demás arbitraria. La física actúa como regularizador de una red genérica.
El modelo aquí descrito representa un caso más estricto: la física no restringe la arquitectura, constituye la arquitectura. El paso hacia adelante completo es el proceso físico —el cómputo explícito y diferenciable de la verosimilitud de Poisson—; no existen capas ocultas que lo aproximen. La contribución del aprendizaje se limita a la estimación de los coeficientes de un modelo cuya forma es conocida a priori.
En síntesis: la arquitectura codifica el conocimiento del dominio y la optimización estima sus parámetros —de manera análoga a plantear las ecuaciones de movimiento de un sistema y ajustar por gradiente sus constantes físicas.
8 Limitaciones
El modelo no incorpora información de plantillas, lesiones, alineaciones, condiciones de campo, factores de rivalidad ni el contexto competitivo del encuentro. Asume independencia condicional entre los goles de local y visitante, supuesto que no se sostiene estrictamente, dado que los equipos ajustan su comportamiento en función del marcador en curso. Los parámetros de equipos con escaso historial reciente presentan mayor varianza de estimación.
En validación retrospectiva, la exactitud en la clasificación de resultado (local/empate/visitante) se sitúa en el rango de 50–55%, frente a una línea base del ≈45% correspondiente a predecir sistemáticamente la victoria local. El desempeño es consistente con el esperado para esta clase de modelos y refleja el elevado componente de aleatoriedad intrínseca del fenómeno.
- Dixon, M. J., & Coles, S. G. (1997). Modelling association football scores and inefficiencies in the football betting market. Journal of the Royal Statistical Society: Series C, 46(2), 265–280.
- Raissi, M., Perdikaris, P., & Karniadakis, G. E. (2019). Physics-informed neural networks. Journal of Computational Physics, 378, 686–707.
Proyecciones en operación
Salidas del modelo para los partidos de la semana, en 16 ligas, recalculadas diariamente.
Ver las proyecciones →Implementación: Python · PyTorch · Flask · SQLite · datos ESPN · Optuna · ejecución diaria programada
La serie donde documento los sistemas, los modelos y las herramientas que construyo. Aquí las matemáticas se ven por dentro.
→ Ver todo El Laboratorio