Brier Score en predicciones deportivas
Cómo se calcula el Brier Score, por qué es distinto de la 'precisión', y cómo se usa para auditar la calibración de un modelo predictivo.

El Brier Score mide qué tan cerca estuvo una probabilidad predicha del resultado real que terminó ocurriendo. Se calcula como el promedio del cuadrado de la diferencia entre la probabilidad que diste y el resultado real (1 si ocurrió, 0 si no): cuanto más bajo, mejor calibrada estuvo la predicción. No mide si “acertaste” el resultado — mide si tu número era honesto.
La fórmula
Para un resultado binario (ocurre / no ocurre):
Brier Score = (1/N) × Σ (probabilidad predicha − resultado real)²
Donde resultado real es 1 si el evento ocurrió y 0 si no, y N es el número de predicciones evaluadas. El resultado va de 0 (predicciones perfectas) a 1 (siempre equivocado en la dirección contraria). Para mercados con más de dos resultados posibles — como 1X2 en fútbol — la fórmula se extiende sumando el término al cuadrado sobre cada categoría, no solo una.
Un ejemplo
Si un modelo dice “70% de probabilidad de que el local gane” y el local efectivamente gana, el error de esa predicción es (0.70 − 1)² = 0.09. Si el local hubiera perdido, el error habría sido (0.70 − 0)² = 0.49. Promediando ese error sobre muchas predicciones —no una sola— se obtiene el Brier Score del modelo.
Precisión y calibración no son lo mismo
Un modelo puede acertar el 70% de sus predicciones y aun así estar mal calibrado si dice “90%” cada vez que solo tiene razón el 70% de las veces. El Brier Score penaliza exactamente ese exceso de confianza — es una métrica de qué tan honesto es el número, no de cuántas veces “ganó”.
Por qué esto importa más que un porcentaje de aciertos suelto
Un titular de “acertamos el 65%” no dice nada sobre calibración: depende por completo de qué tan probables eran esos resultados de partida. El Brier Score obliga a comparar la probabilidad exacta contra el resultado exacto, partido a partido, así que no se puede maquillar eligiendo qué contar como “acierto”.
Cómo se usa para auditar un modelo
Un uso estándar del Brier Score es comparar dos configuraciones del mismo modelo —por ejemplo, dos ponderaciones distintas entre sus componentes— sobre el mismo conjunto de partidos ya liquidados, y quedarse con la que produce un Brier Score menor. Choco Bets recalibra la ponderación de su ensemble contra resultados ya liquidados usando este tipo de métrica, sobre una muestra y una fecha concretas — sin traducir esa mejora en una promesa de acierto futuro, que es justo lo que el Brier Score no mide. Ese proceso de comparar configuraciones contra partidos ya jugados es, en esencia, backtesting: las mismas reglas (nada de datos posteriores al partido, evaluación fuera de muestra) aplican para que la comparación sea honesta.
Límites
- El Brier Score resume muchos partidos en un solo número: dos modelos con el mismo score pueden fallar de formas muy distintas partido a partido.
- Una mejora medida sobre una muestra concreta no se traslada automáticamente a partidos futuros ni a ligas distintas de las que se midió.
- No sustituye revisar el historial real de resultados con su periodo y su muestra — solo audita qué tan bien calibrada estaba la probabilidad, no si el análisis fue útil para decidir.
Preguntas frecuentes
¿Un Brier Score de 0 es posible en la práctica?
No en deporte: implicaría saber con certeza absoluta el resultado de cada partido antes de que se juegue. El objetivo realista es reducirlo de forma consistente sobre una muestra grande, no llegar a cero.
¿Choco Bets publica su Brier Score exacto?
No como cifra de marketing. El análisis reduce parte de la incertidumbre; no la elimina, y una sola cifra de calibración sin su muestra, periodo y metodología completa se presta a leerse como una promesa de acierto, que Choco Bets no hace.
¿Dónde reviso resultados ya liquidados para entender esto con casos reales?
En Resultados puedes revisar encuentros publicados y métricas agregadas con su periodo, muestra y limitaciones.
Ve la calibración aplicada a un partido
La demo pública muestra la probabilidad y la confianza de un encuentro real, con el mismo tipo de contexto que este artículo explica.
