← briefings

8 de octubre de 2026

Qué bueno — Lote 02: tres artículos sobre ratings dinámicos

Glickman y Stern 1998 (modelo bayesiano NFL con dos ritmos de cambio), Kovalchik 2016 (comparación de 11 modelos de tenis contra casas de apuestas), Hvattum y Arntzen 2010 (prueba rigurosa del Elo en fútbol inglés). Lección común: ningún modelo por sí solo supera al mercado.

Reproducir briefingListo
Descargar

Briefing

Hola, Antonio. Este es el lote dos de catorce. Hoy vemos tres trabajos sobre ratings dinámicos: un modelo bayesiano para el fútbol americano de mil novecientos noventa y ocho, una comparación de modelos de tenis de dos mil dieciséis y una prueba rigurosa del sistema Elo en el fútbol de dos mil diez.

Artículo 1 — Glickman y Stern (1998): modelo bayesiano para la NFL

Empezamos con un clásico del fútbol americano. El artículo es de Mark Glickman, entonces en la Universidad de Boston y poco después creador del sistema de clasificación Glicko, y de Hal Stern, de la Universidad Estatal de Iowa. Se publicó en mil novecientos noventa y ocho en la revista de la Asociación Estadounidense de Estadística. Importa porque es una de las bases de los ratings dinámicos: la fuerza de un equipo no es un número fijo, sino algo que se mueve con el tiempo.

El problema. En la liga profesional de fútbol americano de Estados Unidos, la NFL, la calidad de un equipo cambia por dos razones. Dentro de una temporada cambia semana a semana, por lesiones o confianza. Entre temporadas cambia más bruscamente, por fichajes, retiros y cambios de entrenador. Los modelos anteriores fijaban algunos parámetros y así ignoraban parte de la incertidumbre. La pregunta era si un modelo que respete esas dos velocidades puede predecir tan bien como la línea de apuestas de Las Vegas.

La idea. Imagina que cada equipo tiene una fuerza oculta. Solo vemos la diferencia de puntos de cada partido, que depende de la fuerza de ambos equipos, de quién juega en casa y de mucho ruido. De una semana a otra, esa fuerza se desplaza un poco al azar. Entre temporadas, las fuerzas tienden a acercarse al promedio de la liga, algo esperable porque el draft entrega los mejores jugadores jóvenes a los equipos más débiles. Cada equipo tiene además su propia ventaja de local. Todo se estima con métodos bayesianos y simulación, así que el resultado no es un solo pronóstico, sino una distribución completa de resultados posibles. Usaron datos de mil novecientos ochenta y ocho a mil novecientos noventa y tres, con veintiocho equipos.

Los hallazgos. Probaron el modelo en los últimos ciento diez partidos de la temporada mil novecientos noventa y tres. El modelo se equivocó en promedio por diez puntos y medio en la diferencia final, frente a diez coma ocho de la línea de Las Vegas. Acertó al ganador en sesenta y cuatro partidos, un cincuenta y ocho por ciento, contra sesenta y tres de la línea. Y quedó del lado correcto de la línea en sesenta y cinco partidos, casi un sesenta por ciento. Además, la ventaja de local promedio ronda los tres puntos, pero varía por equipo, desde poco más de uno y medio hasta más de siete. Los cambios entre temporadas pesan más que los semanales. Y aun conociendo la fuerza de ambos equipos, el margen de un partido tiene una desviación típica de casi trece puntos. Los diagnósticos mostraron que una ventaja de local única para todos no encajaba con los datos.

Las limitaciones. Los propios autores advierten que ciento diez partidos no bastan para generalizar la ventaja sobre la línea. Los datos tienen más de treinta años. El modelo trata el margen como una curva suave e ignora que márgenes como tres o siete son mucho más frecuentes. No usa lesiones ni estadísticas de juego. Y la simulación es costosa de recalcular cada semana.

Qué significa para tu plataforma. Modela la fuerza de cada equipo con dos ritmos: ajustes pequeños durante la temporada y una regresión hacia la media en la pretemporada. Considera una ventaja de local por equipo, con cautela para no sobreajustar. Produce distribuciones de margen, no solo un favorito, porque de ahí salen las probabilidades de hándicap y ganador. En fútbol americano, ajusta por los números clave. Y hoy puedes implementar esta idea con un filtro de Kalman, mucho más rápido que la simulación original.

Veredicto: vale una inmersión profunda si vas a cubrir fútbol americano o deportes por márgenes, por su marco conceptual; no por su ventaja sobre el mercado, que es pequeña y poco concluyente.

Artículo 2 — Kovalchik (2016): comparación honesta de 11 modelos de tenis

Pasamos ahora a otro deporte, pero con una pregunta muy parecida: cómo medir la fuerza de un competidor que cambia con el tiempo. El segundo artículo nos lleva al tenis. Lo escribió Stephanie Kovalchik, investigadora de Tennis Australia y de la Universidad Victoria, en Melbourne. Se publicó en dos mil dieciséis en una revista especializada en análisis cuantitativo del deporte. El título juega con la expresión inglesa GOAT, el mejor de todos los tiempos, porque busca el mejor modelo para predecir partidos de tenis. Importa porque es la primera comparación directa y justa de los modelos publicados, con las casas de apuestas como vara de medir.

El problema. Existían muchos modelos para predecir partidos de tenis, pero casi nadie los había comparado entre sí con los mismos datos. Cada autor reportaba su propio resultado, con su propio periodo y su propia métrica. Así es imposible saber qué enfoque funciona de verdad.

La idea. Kovalchik reunió once modelos publicados y los agrupó en tres familias. La primera son las regresiones, que predicen al ganador a partir del ranking y otras variables, como edad, estatura o premios en juego. La segunda son los modelos por puntos: estiman la probabilidad de ganar un punto con el saque y al resto, y de ahí calculan la probabilidad de ganar el partido, suponiendo que todos los puntos son independientes. La tercera son las comparaciones por pares, que asignan a cada jugador una fuerza y la actualizan según sus resultados. Aquí entra el Elo adaptado por el sitio de periodismo de datos FiveThirtyEight. Como referencia, usó un consenso de las cuotas de siete casas de apuestas, corregidas por su margen. Todos los modelos se alimentaron con un año de datos previos y se evaluaron en dos mil trescientos noventa y cinco partidos individuales del circuito masculino, la ATP, durante la temporada dos mil catorce. Midió aciertos, calibración, pérdida logarítmica y capacidad de discriminar.

Los hallazgos. Ningún modelo le ganó a las casas de apuestas, que acertaron un setenta y dos por ciento y tuvieron la mejor pérdida logarítmica. El más cercano fue el Elo de FiveThirtyEight usando toda la carrera del jugador, con un setenta por ciento de aciertos. Para partidos con un jugador del top treinta, ese Elo acertó un setenta y cinco por ciento, prácticamente al nivel del mercado. Con jugadores de ranking más bajo, todos los modelos cayeron entre diez y veinte puntos porcentuales. Usar la carrera completa subió el Elo del cincuenta y nueve al sesenta y cuatro por ciento justamente en esos partidos. Otro dato clave: un modelo simple con solo la diferencia de ranking rindió igual que regresiones cargadas de variables. Y los modelos por puntos, salvo uno que ajusta por la calidad del rival, subestimaban a los favoritos y predecían demasiadas sorpresas.

Las limitaciones. Es una sola temporada, solo tenis masculino y solo predicción antes del partido, sin actualización en vivo, que es donde los modelos por puntos podrían brillar. No hay simulación de apuestas, así que no sabemos si alguno habría ganado dinero. Y entre varios modelos las diferencias son de pocos puntos, así que el orden exacto podría cambiar en otra temporada.

Qué significa para tu plataforma. Si vas a cubrir tenis, empieza con un Elo con historial completo: es simple, barato y queda cerca del mercado en la élite. No te ilusiones agregando variables demográficas; el ranking ya contiene casi todo. Separa tus métricas por nivel de jugador, porque en torneos menores la incertidumbre es mucho mayor, y ahí tu modelo y quizá también el mercado son más débiles. Usa el consenso de cuotas como referencia obligatoria. Y si quieres apuestas en vivo, los modelos por puntos son la base, pero calíbralos primero.

Veredicto: vale una inmersión profunda si el tenis está en tu hoja de ruta, porque te ahorra meses de pruebas y te da un punto de partida claro; si no, basta con quedarte con su lección: Elo bien hecho y comparación honesta contra el mercado.

Artículo 3 — Hvattum y Arntzen (2010): Elo riguroso para fútbol inglés

Y para cerrar el lote, volvemos al fútbol, el terreno de Dixon y Coles del lote anterior, pero con un enfoque mucho más simple. El tercer artículo vuelve al fútbol. Lo firman Lars Magnus Hvattum, de la Universidad Noruega de Ciencia y Tecnología, y Halvard Arntzen, del Colegio Universitario de Molde, también en Noruega. Se publicó en dos mil diez en la Revista Internacional de Pronósticos. Importa porque fue de los primeros en poner a prueba, con rigor científico, el uso del sistema Elo para predecir partidos de fútbol, algo que muchos servicios de apuestas ya hacían sin evidencia.

El problema. El Elo nació en el ajedrez y se volvió popular en el fútbol, pero nadie había medido en serio cuánto vale como herramienta de predicción. La pregunta era doble: si un rating Elo predice mejor que otros métodos estadísticos, y si se acerca a las cuotas de las casas de apuestas.

La idea. Cada equipo tiene una puntuación. Tras cada partido, el ganador le quita puntos al perdedor, y se mueven más puntos cuanto más inesperado fue el resultado. Los autores probaron dos versiones. La básica solo mira si hubo victoria, empate o derrota. La segunda también mira la diferencia de goles, de modo que un tres a cero mueve más el rating que un dos a uno. Luego toman la diferencia de rating entre local y visitante y la convierten en tres probabilidades, victoria local, empate y victoria visitante, con un modelo de regresión ordenada. Compararon contra seis referencias: una que asigna un tercio a cada resultado, otra basada en frecuencias históricas, dos modelos estadísticos con decenas de variables de resultados pasados, y dos basados en cuotas, el promedio y la mejor cuota disponible. Usaron las cuatro divisiones del fútbol inglés, de mil novecientos noventa y tres a dos mil ocho, más de treinta mil partidos, con cuotas para más de dieciséis mil.

Los hallazgos. El Elo con diferencia de goles fue el mejor de los métodos estadísticos y superó a los modelos con muchas variables. Pero fue significativamente peor que las cuotas del mercado, tanto en puntaje de Brier como en pérdida logarítmica. En la simulación de apuestas, sobre casi quince mil partidos, ningún método fue rentable. Apostando una unidad cada vez que el modelo veía valor, el Elo recuperaba unos noventa y cuatro centavos por cada unidad apostada. Lo más revelador: cuando exigían una ventaja aparente mayor antes de apostar, los resultados empeoraban. Con una ventaja exigida del treinta por ciento, el retorno caía a unos setenta y ocho centavos por unidad. Es decir, cuando el modelo cree ver una gran oportunidad, casi siempre es el modelo el que se equivoca, no la cuota. El criterio de Kelly tampoco ayudó. Otro dato útil: la ventaja de local equivalía a unos ochenta puntos de rating, y el margen del mercado se redujo con los años, de un retorno esperado de unos noventa y dos centavos a casi noventa y ocho.

Las limitaciones. Solo usa resultados pasados, sin lesiones, alineaciones ni datos de juego. Es solo fútbol inglés y datos de hace más de quince años. El artículo no deja del todo claro si los parámetros del Elo se calibraron fuera del periodo de prueba. Y los modelos de referencia con muchas variables quizás estaban mal estimados, lo que favorece al Elo en la comparación.

Qué significa para tu plataforma. Un Elo con diferencia de goles es un excelente punto de partida: barato, transparente y fácil de mantener en muchas ligas. Úsalo como variable base y agrega información encima. Evalúa tus modelos con pérdida logarítmica y Brier, no con ganancias simuladas, que son demasiado ruidosas. Desconfía de las ventajas grandes: trátalas como señal de error, no como oportunidad. Y recuerda que el mercado es tu rival a vencer, no un techo garantizado.

Veredicto: vale una lectura completa, porque es corto, claro y metodológicamente ejemplar, aunque como modelo por sí solo no te dará ventaja frente a las casas de apuestas.

Comparación final

Para cerrar, una comparación rápida. Glickman y Stern te dan el marco conceptual más sólido para modelar fuerzas que evolucionan, ideal si vas a cubrir fútbol americano. Kovalchik y Hvattum con Arntzen llegan a una conclusión parecida desde dos deportes distintos: un Elo bien construido es una base excelente y barata, pero ninguno de estos modelos, por sí solo, supera al mercado. Si tienes que elegir uno para estudiar a fondo ahora, empieza por Hvattum y Arntzen para fútbol, o por Kovalchik si el tenis está en tus planes. Eso es todo por este lote.