← briefings

8 de octubre de 2026

Qué bueno — Lote 01: tres artículos sobre predicción deportiva y apuestas

Dixon y Coles 1997 (modelo Poisson para fútbol), Hubáček et al. 2019 (descorrelación + cartera Markowitz para NBA), Walsh y Joshi 2024 (calibración > precisión). Veredictos y aplicación a tu plataforma.

Reproducir briefingListo
Descargar

Briefing

Hola, Antonio. En este primer lote repasamos tres artículos sobre modelos de predicción deportiva y apuestas: un clásico del fútbol de mil novecientos noventa y siete, un trabajo de aprendizaje automático sobre la NBA de dos mil diecinueve, y un estudio de dos mil veinticuatro sobre cómo elegir el modelo correcto. La idea es que sepas cuál merece una lectura a fondo y qué puedes llevar a tu plataforma.

Artículo 1 — Dixon y Coles (1997): el modelo Poisson para fútbol

Empezamos con un clásico. El artículo es de Mark Dixon y Stuart Coles, estadísticos de la Universidad de Lancaster, en Inglaterra. Se publicó en mil novecientos noventa y siete en la revista de estadística aplicada de la Real Sociedad de Estadística británica. Importa porque gran parte de los modelos de goles en fútbol que se usan hoy parten de esta idea.

El problema. En el Reino Unido de los años noventa, las casas de apuestas fijaban sus cuotas más o menos una semana antes de cada partido. La pregunta era: ¿puede un modelo estadístico estimar las probabilidades de cada resultado mejor que el corredor de apuestas, y así encontrar apuestas con valor esperado positivo? Para eso hace falta una probabilidad concreta para cada partido, no solo saber qué equipos son buenos a largo plazo.

La idea. Cada equipo recibe dos números: uno que mide su capacidad de ataque y otro que mide su fragilidad defensiva. A eso se suma un factor de ventaja por jugar en casa. Con esos ingredientes, el modelo estima cuántos goles se esperan de cada lado, y supone que los goles llegan como eventos raros e independientes, al estilo de una distribución de Poisson. De ahí sale la probabilidad de cada marcador posible y, sumándolas, la de victoria local, empate o visita.

Las mejoras clave. Los autores añaden dos. La primera: los marcadores bajos, como cero a cero, uno a cero, cero a uno y uno a uno, no se comportan como predice la independencia pura, así que introducen un pequeño ajuste solo para esos resultados. La segunda: los equipos cambian con el tiempo, así que los partidos recientes pesan más que los antiguos, con un peso que decae de forma gradual.

Hallazgos. Usaron seis mil seiscientos veintinueve partidos de liga y copa inglesa, de mil novecientos noventa y dos a mil novecientos noventa y cinco, con noventa y dos equipos. En ese periodo, el cuarenta y seis por ciento de los partidos los ganó el local. Luego lo probaron contra cuotas reales de casas británicas en la temporada noventa y cinco a noventa y seis. La estrategia era sencilla: apostar solo cuando la probabilidad del modelo superaba a la del corredor por un cierto margen. A partir de un margen del diez por ciento, el retorno esperado ya era positivo. Con un margen del veinte por ciento, el resultado quedaba en el límite de ser estadísticamente distinto de perder el once por ciento, que es lo que cobraba el corredor en su ejemplo típico.

Advertencias honestas. Fue una sola temporada de validación, con pocas apuestas, y los autores reconocen que la variabilidad no permite conclusiones definitivas. Era un mercado de los noventa, con márgenes altos y cuotas fijas por una semana, muy distinto del actual. Y el modelo solo usa marcadores: no sabe de lesiones ni alineaciones.

Qué significa para tu plataforma. Este modelo es tu línea base ideal para fútbol. Como produce la matriz completa de marcadores, de un solo modelo sacas de forma coherente el uno equis dos, los totales de goles, ambos anotan, hándicaps y marcador exacto. Incluye desde el principio el decaimiento temporal y la corrección de marcadores bajos. Úsalo como referencia y como insumo para modelos de aprendizaje automático. Y adopta su lógica de apostar solo con un umbral mínimo de ventaja, pero mide esa ventaja contra la cuota de cierre de una casa eficiente, no contra cualquier cuota.

Veredicto: sí vale la pena profundizar, no porque prometa ganancias hoy, sino porque es el cimiento técnico sobre el que vas a construir todo lo demás en fútbol.

Artículo 2 — Hubáček, Šourek y Železný (2019): descorrelación y cartera Markowitz para la NBA

Hasta aquí el fútbol. Ahora cruzamos al baloncesto, con un trabajo que se pregunta cómo ganarle a la casa y no solo acertar resultados. Este artículo es de Ondřej Hubáček, Gustav Šourek y Filip Železný, de la Universidad Técnica Checa, en Praga. Se publicó en dos mil diecinueve en el International Journal of Forecasting. Importa porque plantea una idea que cambia la forma de entrenar modelos de apuestas: no basta con acertar, hay que acertar donde el corredor de apuestas se equivoca.

El problema. En las apuestas a ganador de la NBA, la casa ya tiene un modelo muy bueno, reflejado en sus cuotas, y además cobra un margen. Si tu modelo piensa igual que la casa, aunque sea muy preciso, la cuota ya estará ajustada en tu contra y el margen te irá comiendo. Como dicen los autores, un modelo muy preciso es inútil si coincide con el del corredor.

La propuesta tiene tres ingredientes. El primero es la descorrelación. Al entrenar la red neuronal, además de premiar el acierto, la penalizan cuando sus probabilidades se parecen demasiado a las que implican las cuotas. El segundo es una red neuronal convolucional que lee las estadísticas de los diez jugadores con más minutos de cada equipo, y aprende por sí misma cómo combinarlas en una visión de equipo. El tercero viene de las finanzas: la teoría de carteras de Markowitz. Reparten el dinero de cada jornada buscando la mejor relación entre ganancia esperada y riesgo. Y agregan un filtro de confianza: descartar los partidos donde el modelo ve casi un cincuenta cincuenta.

Los números. Usaron datos de la NBA desde dos mil hasta dos mil catorce, y evaluaron de dos mil seis a dos mil catorce, unos nueve mil noventa y tres partidos, entrenando solo con temporadas pasadas. Las cuotas de dos mil diez a dos mil catorce fueron de cierre de Pinnacle. La casa acertaba al ganador alrededor del sesenta y nueve por ciento de las veces, ligeramente mejor que sus modelos. Cuando el modelo incluía las cuotas como dato de entrada, su correlación con la casa subía de cero coma ochenta y siete a cero coma noventa y cinco. Lo clave: con descorrelación moderada, todos los modelos combinados con la estrategia de cartera dieron ganancias, aun perdiendo algo de precisión. Por ejemplo, un modelo a nivel de equipo pasó de perder casi un uno por ciento a ganar cerca de uno coma cuatro por ciento por jornada. En el escenario más realista, eligiendo la configuración cada temporada según su historial, la ganancia media fue de uno coma seis por ciento por jornada entre dos mil siete y dos mil catorce. Sin descorrelación ni filtro, bajaba a cero coma cuatro, y la estrategia que solo maximizaba la ganancia esperada terminaba en bancarrota.

Advertencias. Las ganancias son finas, de uno a tres por ciento por jornada, y antes de dos mil diez mezclaron cuotas de varias casas, lo que distorsiona la comparación. Asumen que podías apostar a la cuota de cierre, sin límites ni retrasos. Probaron muchas configuraciones, lo que siempre abre la puerta al sobreajuste. Y la NBA de hace más de una década no es el mercado de hoy.

Qué significa para tu plataforma. Agrega como métrica central la correlación de tus probabilidades con la línea de cierre, y vigila cuántas oportunidades detectas donde la casa se equivoca frente a cuántas fallas. Piensa dos veces antes de meter las cuotas como variable de entrada. Trata el tamaño de las apuestas como un problema de cartera, no de intuición.

Veredicto: prioridad alta para profundizar, porque sus ideas de descorrelación y gestión de cartera son directamente implementables, aunque las ganancias reportadas sean modestas y de otra época.

Artículo 3 — Walsh y Joshi (2024): calibración vs precisión

Pasamos al tercer y último artículo, que retoma una idea parecida desde otro ángulo: la calidad de las probabilidades. Cerramos con el más reciente. Este artículo es de Conor Walsh y Alok Joshi, del departamento de informática de la Universidad de Bath, en Inglaterra. Se publicó en dos mil veinticuatro en la revista Machine Learning with Applications. Importa porque pone el foco en una pregunta que muchos equipos de datos ignoran: al elegir un modelo para apostar, ¿hay que mirar cuánto acierta o qué tan confiables son sus probabilidades?

El problema. La mayoría de los trabajos de predicción deportiva eligen el modelo que más acierta al ganador. Pero para apostar no necesitas adivinar quién gana, necesitas saber si la probabilidad real es mayor que la que implica la cuota. Ahí entra la calibración. Un modelo está bien calibrado si, cuando dice setenta por ciento, el evento ocurre más o menos siete de cada diez veces. Un modelo puede acertar mucho y aun así exagerar su confianza.

La idea. Un experimento limpio. Toman cuatro algoritmos clásicos: regresión logística, bosques aleatorios, máquinas de vectores de soporte y una red neuronal sencilla. Hacen dos procesos idénticos de selección de variables y ajuste de parámetros. Uno busca la máxima precisión. El otro busca el menor error de calibración. Luego simulan una temporada completa apostando a todo partido donde el modelo ve valor, con diez mil dólares iniciales y dos reglas: cien dólares fijos por apuesta, o una octava parte de lo que recomienda el criterio de Kelly, que ajusta el monto según la ventaja estimada.

Los resultados. Entrenaron con la NBA desde la temporada dos mil catorce a quince y apostaron en la temporada dos mil dieciocho a diecinueve, con cuotas de cierre de la casa Westgate, de Las Vegas. Ambos campeones fueron máquinas de vectores de soporte, casi igual de precisos: alrededor del sesenta y cuatro por ciento de aciertos. Pero el resultado económico fue muy distinto. Con apuestas fijas, el modelo calibrado ganó un treinta y dos por ciento sobre el capital inicial y el preciso, un cinco y medio. Con Kelly fraccional, el calibrado ganó casi un treinta y siete por ciento y el preciso perdió casi un setenta y seis por ciento. En promedio, más treinta y cinco por ciento contra menos treinta y cinco. La lección de los autores: Kelly solo funciona con un modelo bien calibrado.

Advertencias. Es una sola temporada, con una sola casa, y los propios autores lo reconocen como la crítica principal. También admiten que una de sus reglas para medir la calibración fue algo arbitraria. Una lectura crítica agrega más: ambos modelos apostaron en casi nueve de cada diez partidos, algo raro frente a cuotas de cierre de la NBA, que suelen ser muy eficientes. Ganar más de un treinta por ciento en una temporada contra ese mercado es extraordinario, y con una diferencia de precisión tan pequeña entre los modelos, gran parte del contraste puede deberse al azar. Tampoco hay pruebas de significancia ni límites de apuesta.

Qué significa para tu plataforma. La idea central es correcta y barata de adoptar. Selecciona modelos por calidad probabilística, con medidas como la pérdida logarítmica, el puntaje de Brier y curvas de calibración, no solo por porcentaje de aciertos. Recalibra las probabilidades antes de usarlas para dimensionar apuestas. Usa Kelly fraccional solo cuando hayas verificado la calibración. Y exige siempre pruebas en varias temporadas antes de creer cualquier retorno.

Veredicto: vale una lectura rápida por su mensaje, pero no una inmersión profunda; adopta la idea de la calibración y desconfía de las cifras de ganancia.

Comparación final

Para cerrar, una comparación rápida. Dixon y Coles te dan la base estadística para modelar fútbol y derivar todos los mercados de forma coherente. Hubáček y sus colegas te enseñan que la ventaja está en diferenciarte del mercado y en gestionar el riesgo como una cartera, y es el que más conviene estudiar a fondo. Walsh y Joshi refuerzan una regla práctica, elegir modelos por calibración y no solo por aciertos, aunque sus cifras de ganancia hay que tomarlas con mucha cautela. Eso es todo por este lote.