Tierra y Alma
Nota técnica · El Laboratorio

Pronóstico de resultados de fútbol mediante una red neuronal informada por física

Resumen

Se describe un modelo de pronóstico probabilístico para partidos de fútbol formulado como una red neuronal informada por física (PINN). La arquitectura no consiste en capas densas genéricas, sino en un sistema acoplado de ecuaciones de intensidad cuya forma está dictada por el proceso generador de goles, modelado como dos procesos de Poisson condicionalmente independientes. Los parámetros de fuerza de cada equipo se estiman por retropropagación a través de la verosimilitud de Poisson. El enfoque es una aplicación directa, al dominio deportivo, de la metodología de identificación de parámetros en sistemas dinámicos desarrollada en el trabajo de tesis del autor sobre redes de regulación génica.

1 Planteamiento

El objetivo del sistema es estimar, para cada partido futuro, una distribución de probabilidad sobre sus tres resultados posibles —victoria local, empate, victoria visitante— a partir del historial de resultados de las competiciones involucradas. No se busca predecir el marcador exacto, sino caracterizar la incertidumbre del encuentro.

El problema pertenece a una clase familiar: la identificación de parámetros de un sistema dinámico a partir de observaciones ruidosas. Un equipo posee una fuerza latente no observable; solo se registran sus salidas (goles a favor y en contra) frente a rivales cuya fuerza también es desconocida. La tarea consiste en recuperar los parámetros latentes desacoplando la contribución propia de la del adversario.

Esta clase de problema fue el objeto del trabajo de tesis del autor sobre parametrización de redes de regulación génica. La correspondencia estructural entre ambos dominios es directa:

Redes de regulación génica

  • Sistema dinámico con parámetros latentes
  • Solo se observa la salida (expresión)
  • Se infiere la estructura de regulación
  • Datos escasos y con ruido
  • La cinética del sistema restringe el modelo

Sistema de equipos de fútbol

  • Sistema con parámetros de fuerza latentes
  • Solo se observa la salida (los goles)
  • Se infiere ataque, defensa y estilo
  • Partidos escasos y con ruido
  • El proceso de Poisson restringe el modelo

La metodología empleada aquí traslada el aparato de aquel trabajo —estimación de parámetros restringida por la física del sistema, resuelta por optimización basada en gradiente— al pronóstico deportivo.

2 Principio de diseño: la física como arquitectura

El criterio central de diseño es evitar una arquitectura agnóstica al dominio. En una red densa convencional, las capas y activaciones son arbitrarias y el aprendizaje debe aproximar la función completa desde cero. En el modelo aquí descrito, la forma funcional la impone el proceso físico: cada término tiene una interpretación explícita (ataque, defensa, ventaja de localía, estilo, sesgo de liga), y el aprendizaje se limita a estimar sus coeficientes.

Esto sitúa al modelo dentro del marco de las redes neuronales informadas por física (PINN; Raissi et al., 2019). La distinción respecto a la formulación clásica se precisa en la Sección 6.

3 Parametrización

El modelo mantiene, por equipo y por liga, un conjunto de parámetros ajustables por descenso de gradiente. El total asciende a aproximadamente 11,000 parámetros.

SímboloDominioSignificado
αiCapacidad ofensiva del equipo i
βiCapacidad defensiva del equipo i
hiVentaja de localía específica por equipo
γLSesgo goleador de la liga L
sati, sdefiℝ⁴Vectores latentes de estilo ofensivo y defensivo
μ, rMedia global de gol (log) y tasa de decaimiento temporal
Nota terminológica. Los parámetros α, β, h, γ son escalares con interpretación física directa; no constituyen embeddings en sentido estricto. Los únicos embeddings del modelo son los vectores de estilo sat, sdef ∈ ℝ⁴: representaciones densas aprendidas cuyas componentes carecen de significado individual y cuya información reside en su geometría relativa.

4 Sistema acoplado de intensidades

Para un partido entre el equipo local i y el visitante j en la liga L, las tasas de gol esperadas λ se definen en escala logarítmica como una suma de términos interpretables:

(1)logλlocal=μ+γL+αi+hiβj+siatsjdef\log \lambda_{\text{local}} = \mu + \gamma_L + \alpha_i + h_i - \beta_j + \mathbf{s}^{at}_i \cdot \mathbf{s}^{def}_j
(2)logλvisita=μ+γL+αjβi+sjatsidef\log \lambda_{\text{visita}} = \mu + \gamma_L + \alpha_j - \beta_i + \mathbf{s}^{at}_j \cdot \mathbf{s}^{def}_i

El sistema es acoplado: el parámetro defensivo del local, βi, aparece en la intensidad del visitante, de modo que ambos conjuntos de parámetros se estiman conjuntamente. La formulación es equivalente a un modelo de efectos mixtos aditivos en escala logarítmica, emparentado con los sistemas Elo y Bradley–Terry.

Término bilineal de estilo

El producto interno sati · sdefj modela efectos de emparejamiento (matchup): la interacción sistemática entre el estilo ofensivo de un equipo y el estilo defensivo de su rival, no capturada por las fuerzas escalares. Su ventaja computacional es central: una parametrización explícita por par de equipos escalaría como O(N²), intratable con los volúmenes de datos disponibles por par. La factorización en vectores de dimensión k = 4 reduce la complejidad a O(N·k), y el efecto de emparejamiento emerge de la geometría del espacio latente.

Fig. 1 Representación del término bilineal. Proyección 2D de los vectores de estilo ofensivo (verde) y defensivo (azul). Su producto interno determina el signo y la magnitud del ajuste de emparejamiento sobre la intensidad esperada.
Estimación conjunta entre competiciones. La totalidad de los partidos actualiza el mismo conjunto de parámetros por equipo, con independencia de la competición. Los resultados de un equipo en distintos torneos (p. ej. liga doméstica y competición continental) informan los mismos α, β. El modelo estima un único grafo global de fuerzas relativas.

5 Distribución de marcadores

Bajo el supuesto de independencia condicional de Poisson, la probabilidad de un marcador exacto (gh, ga) es el producto de dos distribuciones de Poisson con parámetros λh y λa:

(3)P(gh,ga)=eλhλhghgh!eλaλagaga!P(g_h, g_a) = \frac{e^{-\lambda_h}\lambda_h^{g_h}}{g_h!}\cdot \frac{e^{-\lambda_a}\lambda_a^{g_a}}{g_a!}

Se evalúa una matriz de marcadores M ∈ ℝ9×9 (marcadores de 0 a 8 por equipo). Las probabilidades de los tres resultados se obtienen sumando sus regiones:

(4)P(local)= ⁣ ⁣gh>ga ⁣ ⁣Mgh,ga,P(empate)= ⁣ ⁣gh=ga ⁣ ⁣Mgh,ga,P(visita)= ⁣ ⁣gh<ga ⁣ ⁣Mgh,gaP(\text{local}) = \!\!\sum_{g_h > g_a}\!\! M_{g_h,g_a}, \quad P(\text{empate}) = \!\!\sum_{g_h = g_a}\!\! M_{g_h,g_a}, \quad P(\text{visita}) = \!\!\sum_{g_h < g_a}\!\! M_{g_h,g_a}
Fig. 2 Matriz de marcadores para un caso ilustrativo (λlocal = 1.55, λvisita = 1.15). Verde: región de victoria local; gris: empate; azul: victoria visitante. La barra inferior muestra las probabilidades marginales resultantes.

La evaluación de la verosimilitud de Poisson se realiza dentro del grafo de diferenciación automática, de forma que el gradiente de la función de pérdida se propaga a través de ella hasta los parámetros de equipo. No existe una capa densa que aproxime el proceso generador: el proceso se computa de forma exacta y la optimización opera a través de él.

6 Función de pérdida y decaimiento temporal aprendido

El modelo se entrena minimizando la entropía cruzada ponderada temporalmente. Cada partido histórico t, con resultado observado yt, contribuye con un peso decreciente en su antigüedad dt:

(5)L=1Nt=1Nwtlogpyt(t),wt=erdt\mathcal{L} = -\frac{1}{N}\sum_{t=1}^{N} w_t\, \log p_{y_t}(t), \qquad w_t = e^{-r\, d_t}

La tasa de decaimiento r no se fija a priori: es un parámetro aprendible, reparametrizado mediante softplus para garantizar su positividad,

(6)r=softplus(r~)=ln(1+er~)>0r = \text{softplus}(\tilde r) = \ln(1 + e^{\tilde r}) > 0

El modelo estima así, a partir de los datos, la escala temporal relevante del historial. El valor obtenido tras el entrenamiento corresponde a una vida media de aproximadamente 119 días: un partido de esa antigüedad contribuye a la estimación con la mitad del peso de uno reciente.

Fig. 3 Función de ponderación temporal w = e−r·d. La tasa r se estima conjuntamente con el resto de parámetros; el valor aprendido equivale a una vida media de ≈119 días.

Optimización

La estimación se realiza con el optimizador Adam bajo un protocolo walk-forward (cada partido emplea únicamente historial anterior a su fecha). La tasa de aprendizaje η y el coeficiente de regularización L2 λwd se determinan por optimización bayesiana de hiperparámetros (Optuna). La regla de actualización es la de Adam con decaimiento de pesos:

(7)θ(t+1)=θ(t)ηm^tv^t+εηλwdθ(t)\theta^{(t+1)} = \theta^{(t)} - \eta\,\frac{\hat m_t}{\sqrt{\hat v_t} + \varepsilon} - \eta\,\lambda_{\text{wd}}\,\theta^{(t)}
Grupo de parámetrosPor equipo
α, β, h3
sat, sdef (2k)8
γL (por liga)1 / liga
μ, r (globales)2 total
Escala total≈ 11,000

7 Clasificación como PINN

En la formulación clásica (Raissi et al., 2019), una PINN incorpora la física como restricción en la función de pérdida: el residuo de una ecuación diferencial penaliza las soluciones que violan la ley física, sobre una arquitectura por lo demás arbitraria. La física actúa como regularizador de una red genérica.

El modelo aquí descrito representa un caso más estricto: la física no restringe la arquitectura, constituye la arquitectura. El paso hacia adelante completo es el proceso físico —el cómputo explícito y diferenciable de la verosimilitud de Poisson—; no existen capas ocultas que lo aproximen. La contribución del aprendizaje se limita a la estimación de los coeficientes de un modelo cuya forma es conocida a priori.

Ventaja sobre los métodos clásicos de estimación. Formulaciones como Elo o Dixon–Coles se ajustan por mínimos cuadrados iterativos o máxima verosimilitud, y no admiten con facilidad términos no lineales. Al plantear el problema como una red diferenciable, tanto el término bilineal de estilo como el decaimiento temporal aprendible se integran de forma natural en el mismo esquema de optimización por gradiente, conservando la interpretabilidad del modelo paramétrico.

En síntesis: la arquitectura codifica el conocimiento del dominio y la optimización estima sus parámetros —de manera análoga a plantear las ecuaciones de movimiento de un sistema y ajustar por gradiente sus constantes físicas.

8 Limitaciones

El modelo no incorpora información de plantillas, lesiones, alineaciones, condiciones de campo, factores de rivalidad ni el contexto competitivo del encuentro. Asume independencia condicional entre los goles de local y visitante, supuesto que no se sostiene estrictamente, dado que los equipos ajustan su comportamiento en función del marcador en curso. Los parámetros de equipos con escaso historial reciente presentan mayor varianza de estimación.

En validación retrospectiva, la exactitud en la clasificación de resultado (local/empate/visitante) se sitúa en el rango de 50–55%, frente a una línea base del ≈45% correspondiente a predecir sistemáticamente la victoria local. El desempeño es consistente con el esperado para esta clase de modelos y refleja el elevado componente de aleatoriedad intrínseca del fenómeno.

Aviso
Este trabajo constituye un ejercicio de modelado estadístico y no un servicio de pronóstico con fines de apuesta. Las salidas del modelo son probabilidades calibradas, no predicciones deterministas: un resultado estimado con probabilidad 0.70 no se verifica en aproximadamente el 30% de los casos, comportamiento esperado bajo calibración correcta. Ninguna parte de este documento constituye asesoría financiera ni recomendación de apuesta.
Referencias
  1. Dixon, M. J., & Coles, S. G. (1997). Modelling association football scores and inefficiencies in the football betting market. Journal of the Royal Statistical Society: Series C, 46(2), 265–280.
  2. Raissi, M., Perdikaris, P., & Karniadakis, G. E. (2019). Physics-informed neural networks. Journal of Computational Physics, 378, 686–707.

Proyecciones en operación

Salidas del modelo para los partidos de la semana, en 16 ligas, recalculadas diariamente.

Ver las proyecciones →

Implementación: Python · PyTorch · Flask · SQLite · datos ESPN · Optuna · ejecución diaria programada

El Laboratorio

La serie donde documento los sistemas, los modelos y las herramientas que construyo. Aquí las matemáticas se ven por dentro.

→ Ver todo El Laboratorio