Saltar al contenido
Datos y probabilidades

Backtesting de predicciones deportivas

Qué es el backtesting, qué reglas debe respetar para ser válido, un ejemplo numérico paso a paso, y los errores que más lo invalidan.

Equipo Choco Bets 5 min de lectura
Diagrama editorial de una línea de tiempo con partidos evaluados retrospectivamente

El backtesting es el proceso de evaluar un modelo predictivo corriéndolo sobre partidos que ya se jugaron —nunca sobre los que se está intentando predecir— para medir qué tan bien habría funcionado antes de confiar en él hacia adelante. No prueba que el modelo vaya a acertar en el futuro; prueba qué tan calibrado estuvo en el pasado.

Qué es y para qué sirve

Un backtest toma un conjunto de partidos históricos, genera la predicción que el modelo habría dado en ese momento (con la información disponible antes del partido, no después) y compara esa predicción contra el resultado real. Repetido sobre muchos partidos, permite calcular métricas de calibración como el Brier Score en vez de depender de la impresión de un puñado de aciertos sueltos.

Las reglas que un backtest tiene que respetar

  • Solo información disponible antes del partido. Usar datos posteriores al pitido inicial (alineación final confirmada tarde, resultado de otro partido que afecta contexto) es data leakage: infla artificialmente el resultado del backtest de una forma que no se puede replicar en producción.
  • Evaluación fuera de muestra. El modelo no debería ajustarse usando los mismos partidos sobre los que después se mide su desempeño — eso es sobreajuste, no evaluación.
  • Orden temporal respetado (walk-forward). Entrenar o calibrar con partidos futuros para “predecir” partidos pasados invierte la causalidad y no significa nada sobre el desempeño real.
  • Muestra suficiente. Un backtest sobre 20 partidos tiene mucho ruido; las métricas se vuelven más estables cuanto mayor es la muestra.

Un ejemplo paso a paso

Cinco partidos ya liquidados, con la probabilidad que un modelo habría asignado a “el local gana” antes de cada uno:

Partido Probabilidad predicha ¿Ganó el local? Error al cuadrado
1 0.70 (0.70−1)² = 0.09
2 0.55 No (0.55−0)² = 0.3025
3 0.40 No (0.40−0)² = 0.16
4 0.65 (0.65−1)² = 0.1225
5 0.30 (0.30−1)² = 0.49

Brier Score del backtest: (0.09 + 0.3025 + 0.16 + 0.1225 + 0.49) / 5 = 1.165 / 5 = 0.233.

Con solo 5 partidos esta cifra es puramente ilustrativa —la varianza a esa escala es enorme—, pero muestra el mecanismo: cada predicción se compara contra su resultado real, nunca contra un promedio general de aciertos.

Esto es un ejemplo matemático, no un resultado de Choco Bets

Los cinco partidos y probabilidades de la tabla son ilustrativos para explicar el cálculo — no son datos de producción ni una cifra publicada de ningún modelo. El historial real de Choco Bets muestra encuentros publicados con su periodo y muestra reales.

Qué NO es backtesting

Ajustar repetidamente los parámetros de un modelo hasta que su backtest se ve bien no es backtesting — es sobreajustar (curve-fitting) al histórico. Un modelo así puede lucir excelente en los datos con los que se ajustó y fallar en cuanto ve partidos nuevos, precisamente porque aprendió el ruido de esa muestra concreta, no un patrón real.

Errores comunes

  • Sobreajuste al histórico: calibrar tanto contra el pasado que el modelo deja de generalizar a partidos nuevos.
  • Data leakage / look-ahead bias: usar, sin darse cuenta, información que no estaba disponible en el momento del partido.
  • Cherry-picking del periodo evaluado: elegir la ventana de fechas que hace ver mejor al modelo en vez de fijar el periodo antes de correr el backtest.
  • Confundir un buen backtest con una garantía futura. El backtest mide calibración histórica, no promete nada sobre partidos que todavía no se jugaron.

Limitaciones

  • El rendimiento pasado no garantiza resultados futuros — describe un periodo observado con su propia muestra y límites.
  • Un backtest solo es tan bueno como los datos históricos con los que se construyó; datos incompletos o mal etiquetados producen conclusiones erróneas aunque la metodología sea correcta.
  • Distintas ligas y periodos pueden comportarse de forma distinta; un backtest sobre una liga no se traslada automáticamente a otra.

Preguntas frecuentes

¿Un buen resultado en el backtest garantiza que el modelo funcionará en el futuro?

No. Solo indica que, sobre los partidos evaluados y con las reglas anteriores respetadas, el modelo estuvo razonablemente calibrado. El futuro puede comportarse distinto a la muestra histórica.

¿Cuántos partidos hacen falta para que un backtest sea confiable?

No hay un número mágico, pero cuantos más partidos, menor la varianza de la métrica resultante. Docenas de partidos dan una idea inicial; cientos son mucho más informativos que decenas.

¿Dónde puedo revisar cómo Choco Bets documenta esta parte de su proceso?

En Metodología se explican procedencia, preparación y límites, y la guía de dashboard y backtesting cubre el lado de producto.

Revisa resultados ya liquidados

En Resultados puedes ver encuentros publicados con su periodo y muestra reales — el mismo tipo de historial sobre el que se corre un backtest.

Artículos relacionados