Mostrando entradas con la etiqueta Fútbol. Mostrar todas las entradas
Mostrando entradas con la etiqueta Fútbol. Mostrar todas las entradas

Aplicacion de Poisson en el Futbol y otros deportes

Sois muchos los que me estáis pidiendo que os de acceso a ficheros de Excel que tengo colgados en el drive, y a otros que, por motivos varios, han desaparecido de la web. Estoy ya bastante desconectado de las apuestas, porque, os digan lo que os digan, los únicos que ganan en esto de las apuestas son las casas. Lo digo con conocimiento de causa y después de que me hayan cerrado decenas de cuentas por ganar dinero, la última sin ir mas lejos me la cerraron después de hacer menos de 20 apuestas y con un beneficio de unos 50 Euros.

Cuando la casa detecta que puedes ser un riesgo para ellos, te cierran la cuenta (como me hicieron en William Hill) o te dejan apostar cantidades ridículas de dinero (como me hicieron los de Bet365). Después de esta advertencia cada uno que haga lo que crea conveniente, pero ya os digo que todo aquel que os diga que gana dinero de manera constante con las apuestas os estará mintiendo el 95% de las veces.

Volviendo al tema inicial, tengo un montón de ficheros Excel con datos, estadísticas y estrategias, que si tengo tiempo iré compartiendo por el blog. Uno de los que más me pedís es el de calculo de probabilidades de Poisson, y es el primero que os compartiré. Como comento en la entrada inicial sobre este asunto:

Solo es necesario rellenar las cuatro celdas con los partidos jugados por cada equipo y los goles anotados. El resto se calcula automáticamente.

Y la idea sería apostar a aquellos resultados o eventos en los que la cuota que nos indica el libro de excel sea MENOR que la cuota que nos ofrece la casa de apuestas.

Espero que os sirva

Enlace al fichero:
https://drive.google.com/file/d/1YsK_AefR39nG2UbA-wJKD1beGKCFssmI/view?usp=sharing

Modelo de prediccion de resultados de un partido de Futbol (Paso2)

En primer lugar quiero agradecer a todos los que han colaborado con las sugerencias el tiempo que me han dedicado enviado los factores que para ellos eran importantes. Ya hemos recogido unos cuantos y podemos empezar a comentarlo.

Empezamos por orden de importancia en cuanto a la cantidad de sugerencias recibidas:

 1. Goles: Ha sido el factor más votado y es el más fácil de conseguir, con lo que tiene todo para ser considerado como uno de los principales en el modelo de predicción. En algunos casos no se especifica claramente, pero tomaremos los goles a favor, y en contra de los dos equipos.

2. Bajas: El segundo factor más votado han sido las bajas. Este ya tiene un poco más de dificultad porque los modelos deben incluir parámetros transversales, es decir, que sean cuantificables en todo el conjunto de datos que tengamos para ajustar el modelo y para predecir. Así que deberemos traducir el factor BAJAS a algo valorable en cada equipo, relacionado con las alineaciones. Se me ocurre algo parecido a los puntos que tiene cada cromo de la liga, o bien puntos o euros que cuesta cada jugador en Comunio, o algo similar. Un sistema de puntuacion similar al de Fanaticleague sería ideal. Se aceptan sugerencias también para esto.



3. Arbitro: No ha sido mayoritaria pero algunos de vosotros ha considerado que esta variable también debe ser incluida en el modelo. En este caso pasa algo similar a lo que hemos comentado con las bajas, hay que cuantificar también. Podría ser el % de partidos ganados empatados y perdidos del equipo de casa cuando pita un determinado colegiado y lo mismo para el de fuera. Aceptamos, por supuesto, otras sugerencias.

4. Clima: Otro factor dificilmente cuantificable, al que incluso podríamos añadir hora del partido (mañana / tarde / noche).  Mi propuesta sería hacer algo similar al caso del arbitro, % de partidos ganados / empatados / perdidos.

Con estos factores acabamos la entrada de hoy, en la siguiente continuaremos con los que quedan, pero antes me gustaría proponer algunos más que curiosamente no han recibido ningún voto:

  • Distancia recorrida por el equipo visitante. Hay estudios que indican que hay una relacion entre victorias visitantes / locales dependiendo de las distancias recorridas por el equipo visitante.
  • Estrategia / Esquema de juego de cada equipo. 
  • Ponderación de partidos o goles en función de la fortaleza del equipo contra el que se ha jugado (algo similar al rating ELO de los jugadores de ajedrez), es decir, no es lo mismo haber jugado 5 partidos contra los últimos equipos de la liga que contra los primeros. 
Un saludo y sigo atento a vuestras sugerencias.

Modelo de prediccion de resultados de un partido de Futbol (Paso1)

Hola a todos,

La idea de este post es comenzar el desarrollo de un modelo de predicción de resultados de un partido de fútbol con la colaboración de todos los visitantes del blog. El primer paso para crear nuestro modelo va a ser una tormenta de ideas (brainstorming) para recoger todos los factores posibles que debería incluir el modelo.

Para ir recogiendo las respuestas he creado el siguiente formulario:



En el campo del formulario poned solo un factor y lo enviais. Si quereis agregar otro solo teneis que volver a rellenar el campo y pulsar enviar otra vez. Dejaré un tiempo prudencial el formulario para ir recogiendo las respuestas y luego haremos un análisis de los resultados. Un saludo a todos y gracias por vuestra colaboración.

Rabdómeros, rodopsinas y la copa del mundo

Volvemos a la brecha después de las merecidas vacaciones estivales con uno de los personajes más populares de este verano. Y no me estoy refiriendo a Sara Carbonero o a Iker Casillas sino a un pulpo de nombre Paul que ha desbancado a Bob Esponja como animal marino más famoso.

El bichejo en cuestión empezó a incrementar su popularidad a partir de sus aciertos en las predicciones de los partidos de Alemania en la Eurocopa del 2008 y siguió con su festival de aciertos en el mundial de Sudáfrica de este año, finalizando con un pleno en sus predicciones en este campeonato. ¿Suerte, engaño, farsa...?.

Buscando información sobre el tema, hay suficiente para escribir un libro. Alguna de las explicaciones sobre su capacidad adivinatoria son realmente increíbles y pasan desdes el engaño, hasta el efecto 'Clever Hans' (no os preocupeis si os suena a chino porque yo tampoco lo había oido nunca) o incluso el efecto Pigmalión.

No faltan tampoco aquellas que hablan de los colores de las banderas, la imposibilidad de los pulpos de distinguir colores, debido a los rabdómeros (células fotoreceptoras del ojo del pulpo) y las rodopsinas (pigmento visual que permite distinguir los colores).

La verdad es sea como fuere, lo que es irrefutable es que este simpático 'cabezon', hizo un pleno de aciertos en sus predicciones. Pero bueno, dejando un poco a parte este tipo de análisis lúdico-folclórico nos vamos a centrar lo que me va, los números.

Tomando como base las cuotas de los partidos para calcular la probabilidad de cada uno de los resultados, tenemos que ha predicho el resultado de 8 partidos con estas cuotas.


La probabilidad final acumulada es el producto de todas las probabilidades y es igual a un ínfimo 0.056%, o lo que es lo mismo un caso entre 1773. Con estos porcentajes cualquier test estadístico diría que el resultado no es fruto del azar. ¿Será posible que el dichoso pulpo pueda adivinar resultados de partidos?. Ante la luz fría de estos datos, parece que sí. Pero si hiciésemos este mismo análisis con cualquiera de los acertantes de una combinación de la lotería primitiva obtendríamos el mismo resultado y no creo que ninguno de ellos tenga un método para adivinar los malditos numeritos.

Yo me inclino a una mezcla entre azar y marketing. Me explico. Suponiendo que al principio del mundial hubiesen iniciado su carrera de futurólogos 100 animales de todo tipo, pulpos, caballos, jerbos y hasta, ... yo que sé, escarabajos peloteros. En en el primer partido la mitad de ellos hubieran fallado sus predicciones (suponemos que aleatoriamente eligen un equipo u otro como vencedor). Para el segundo ya solo nos quedarían 25 aspirantes, en el tercero nos quedarían solo 12. Aquí finaliza la fase de grupos y es cuando el pulpo Paul comenzaría a cobrar popularidad. Siguiendo con este razonamiento llegaríamos al partido final en el que solo nuestro protagonista ha pasado todas las pruebas y se jugaría el resultado final a un 60-40 para España (desestimamos el 28% del empate y lo asignamos por igual a los otros dos resultados). De esta forma no lo veo tan raro como se me hacía al principio, aunque no podría decir rotundamente no a cualquier otra explicación que se ha dado sobre el tema. Así que dejo al lector que elija la que sea más apropiada para él.

Un saludo a todos y feliz retorno de vacaciones.

Cálculo de probabilidades de Poisson

Hace cosa de unos quince días, en una de mis visitas rutinarias al blog, me llevé la sorpresa de que había más de 40 visitantes online. Pensé que sería un error del contador pero resultó ser que no, en dos días recibí más visitas que en todo un mes, y todo ello debido a que Mr. Lucky, un colaborador de Marca, me había enlazado la página en la que hablaba de la distribución de Poisson.

Como agradecimiento había pensado colocar una especie de formulario en el blog para que los visitantes pudiesen calcular de manera sencilla las probabilidades por Poisson de un partido partiendo de la media de goles de los dos equipos.

Al final he conseguido mediante Javascript una especie de formulario que funciona correctamente, pero no se como insertarlo en una entrada. Si alguien lo sabe le agradecería que me dijese como he de hacerlo.

El formulario es bastante sencillote, no me he calentado la cabeza con cosas bonitas porque pensaba meterlo en el blog. Simplemente hay que rellenar las dos casillas de la media de goles de los dos equipos y pulsar sobre calcular.

El formulario te devolverá las probabilidades de cada uno de los resultados y sus cuotas teóricas asociadas.

Lo he conseguido colocar dentro de las mil historias que tiene Google para almacenar páginas y podeis acceder a él a través de este enlace:

EDITO 19/04/2020: Pues edit grid lo cerraron hace años, así que os dejo el fichero en el drive de GOOGLE. Podeis acceder a él a través del siguiente enlace:

https://drive.google.com/file/d/1YsK_AefR39nG2UbA-wJKD1beGKCFssmI/view?usp=sharing


Solo es necesario rellenar las cuatro celdas con los partidos jugados por cada equipo y los goles anotados. El resto se calcula automáticamente.

Y la idea sería apostar a aquellos resultados o eventos en los que la cuota que nos indica el libro de excel sea MENOR que la cuota que nos ofrece la casa de apuestas.

Todos los ficheros que comparto en Drive están protegidos,  para poder utilizarlos los teneis que descargar, para ello debeis ir a Archivo > Descargar > Microsoft Excel




Espero que os sirva

La ventaja del factor campo: Análisis Primera División Española

En esta segunda y última entrada vamos a analizar los datos de los últimos 30 años de la primera división del fútbol español para comprobar si existe la ventaja del factor campo y si es cuantificable. Para ello vamos a tomar datos desde la temporada 1978-1979 a la 2008-2009 de la media de goles marcados por temporada por los equipos locales y los visitantes.

Si observamos los datos de la media de goles de los equipos locales por temporada vemos que durante los últimos 30 años la media de goles marcados por los equipos locales ha ido oscilando en torno a 1.57, y se ha mantenido más o menos estable en torno a ese valor, salvo las 6 primeras temporadas en las que la media de goles había sido ligeramente superior.


Analizando los goles por partido de los equipos visitantes observamos algo completamente diferente:


Desde 1978 a 1993 aproximadamente, la media de goles visitantes se mantenía bastante estable por debajo de 1 mientras que rondando el año 1993 se produce un cambio importante y la media pasa a situarse por encima de 1 gol por partido. ¿Qué sucedió en torno al año 93 para que se produzca este cambio?. Algún acontecimiento destacable sucedió en nuestra liga durante esos años y ha originado un cambio importante en la cantidad de goles que anotan los equipos visitantes. Y efectivamente, así es, si dividimos el gráfico en dos períodos, uno hasta el año 94 y otro del 95 en adelante se ve el cambio perfectamente:


Antes del año 95 los equipos visitantes anotaban de media 0.9 goles por partido y a partir de ese año la media se ha incrementado hasta los 1.1 goles por partido. Para los que no lo recuerden en 1995 se produjo el cambio de puntuación por partido ganado de 2 a 3 puntos. Al contrario de lo que cabría suponer, esta modificación no afectó en gran manera al comportamiento de los equipos locales pero sí que lo hizo con los visitantes. Con la condición actual, la diferencia entre empatar y ganar el partido es mayor que antes, y los equipos visitantes tienden ahora a intentar llevarse los tres puntos antes que ‘perder’ dos con un empate.

Este mismo efecto se ha producido también en la Premier League cuando se produjo el mismo cambio de puntuación. En ambos casos la ventaja del factor campo se ha visto afectada con esta decisión de las federaciones y en el caso español se ha pasado de una diferencia media de goles a favor del equipo local de 0.685 en las ligas de 2 puntos a 0.444 en las ligas de 3 puntos. Esta diferencia entre uno y otro período es significativa estadísticamente hablando y está motivada exclusivamente por el cambio que se ha producido en la cantidad de goles anotada por los equipos visitantes.

Así pues, hablando de la liga española podemos decir que, aunque la ventaja del factor campo se ha visto reducida a 0.44 goles por el cambio de puntuación, esta ventaja sigue siendo significativa y concuerda con los resultados de los estudios realizados en otros países. Y además, podríamos añadir a la lista de factores ya mencionados en el anterior artículo, el del criterio de puntuación en la liga, que como hemos visto, afecta negativamente a la ventaja del equipo local.

La ventaja del factor campo

Se puede definir lo que los ingleses llaman Home Field Advantage (HFA), o como vamos a llamarle nosotros, la ventaja del factor campo, como una diferencia entre los resultados obtenidos por los equipos cuando juegan en casa y cuando juegan fuera. Esta diferencia se puede medir bien en función de la cantidad de puntos obtenidos jugando como local frente a los puntos totales conseguidos durante toda la liga, o bien en función de la cantidad de goles, conseguidos o recibidos, por los equipos cuando juegan de locales y cuando lo hacen como visitantes.

Si se analizan diferentes ligas europeas la ventaja local varía dependiendo del país, según indican Pollard y Pollard en sus estudios. En las ligas Balcánicas, por ejemplo, el porcentaje de victorias de los equipos locales frente al total de victorias conseguidas se acerca al 70%. En el otro extremo se encuentran las ligas Bálticas donde este porcentaje se reduce hasta colocarse cerca del 50%. En una liga en la que la ventaja del equipo local fuese nula los equipos ganarían la misma cantidad de partidos jugando como locales que jugando como visitantes con lo que el porcentaje de victorias locales frente al total de victorias sería muy cercano al 50% como ocurre en las ligas Bálticas.

Esta ventaja también es patente en competiciones europeas como la UEFA Champions League e incluso hay autores, como Dowie, que utilizan este argumento para justificar los triunfos de Uruguay (1930), Italia (1934), Inglaterra (1966), Alemania (1974), Argentina (1978) y Francia (1998) en los mundiales donde los equipos ganadores han sido los anfitriones. Si analizamos los datos de partidos ganados frente a total de partidos jugados de los equipos anfitriones en los mundiales el porcentaje se acerca al 64%.

De los numerosos factores que se utilizan para justificar esta ventaja del equipo local, podemos destacar cuatro principales:

1. El apoyo de la afición
2. El cansancio de los equipos visitantes en sus desplazamientos
3. Disposiciones tácticas
4. Factores psicológicos

El apoyo de la afición:
Es evidente que el aficionado que va a un campo de fútbol suele hacerlo con la intención de ayudar a su equipo a conseguir un resultado positivo. Casi todos coincidiremos en que el apoyo de la afición es un factor importante a la hora de potenciar los resultados del equipo local. Todos hemos oído hablar en más de una ocasión del jugador número 12 haciendo referencia al público asistente en un estadio. Sin embargo este factor es difícilmente cuantificable y su interpretación es cuanto menos dudosa. Aunque hay estudios como el de Ryan Boyko, investigador de la universidad de Harvard, que después de analizar más de 5000 partidos de la Premier afirma que por cada 10.000 aficionados en un campo de futbol la ventaja local aumenta en 0.1 goles. Esto resulta interesante si consideramos que campos como el del Barcelona pueden reunir a más de 100.000 personas en partidos importantes.

Otros autores han relacionado este factor con la posibilidad de influir en las decisiones arbitrales. Aficiones numerosas y muy ruidosas pueden llegar a desnivelar la justa balanza arbitral a favor del equipo local. Y así hay estudios en los que se ha evidenciado un desequilibrio en el número de tarjetas rojas y penaltis recibidos por equipos que juegan como locales y los que lo hacen como visitantes. Estos estudios sugieren que esta parcialidad arbitral, supuestamente inconsciente, puede venir provocada por el ruido ambiental generado por la grada.

El cansancio de los equipos visitantes en sus desplazamientos
Aunque hay autores como Pollard que no han encontrado diferencias en los resultados entre equipos que juegan a distancias menores de 300 Km, hay otros, como Brown et al., que encontraron que la ventaja de jugar como local aumentaba en función de la distancia que recorría el equipo visitante. Este factor podría ser una de las causas de los resultados ya comentados, de los equipos locales en las competiciones europeas o de los mundiales.

Disposiciones tácticas
La mayoría de equipos visitantes, bien sea conscientemente o inconscientemente, adaptan su disposición táctica en función de esa condición de visitante, lo que se traduce en una mentalidad ligeramente más conservadora. Este factor se hace mucho más importante en las eliminatorias a doble partido. Una derrota por un gol hay ocasiones que puede ser un buen resultado para un equipo visitante en el primer partido de la eliminatoria.

Factores psicológicos

Dentro de este grupo se pueden incluir factores relacionados con la territorialidad, el conocimiento del terreno de juego y el entorno, o incluso la propia creencia de los jugadores y entrenadores en esta ventaja de jugar como local.

Como hemos visto, son numerosos los estudios que hay intentando demostrar que existen factores que afectan al rendimiento de un equipo cuando juega en casa, aunque es realmente difícil establecer una relación causa-efecto, debido a la poca ‘potencia’ que tienen los datos utilizados y a las numerosas interrelaciones que tienen estos factores entre sí. A pesar de todo ello, lo que sí parece evidente, es que esta ventaja existe y puede ser cuantificada.

La cristianodependencia del Real Madrid...

... o saben los periódicos deportivos utilizar las estadísticas?. Hace un par de días el diario MARCA sacó en portada una noticia 'reveladora': Con CR9 el Real Madrid es el doble de bueno. Y subtitulaba: Estadísticamente hay cristianodependencia. La conclusión es demoledora, el Madrid marca de media 2.9 goles por partido con CR9 en el campo, mientras que cuando el portugués no ha jugado la media ha bajado a casi la mitad 1.5 goles por partido. Defensivamente ocurre algo similar, con Cristiano Ronaldo en el campo recibe una media de 0.7 goles por partido, frente a los 1.4 que reciben cuando él no juega.

Las estadísticas de MARCA son muy llamativas, pero con estos datos ¿podemos afirmar lo que dice MARCA con esa contundencia?, ¿son estas diferencias lo suficientemente grandes como para decir que no son debidas al azar?. ¿Habrían utilizado alguna herramienta estadística para confirmar esa afirmación?.

Como no eran demasiados partidos, 11 con CR9 y 10 sin él (descontando el jugado ayer en Valencia). Me puse a buscar los resultados, porque con los datos que proporcionaba MARCA, ES IMPOSIBLE saber si las diferencias son estadisticamente significativas. Así que usando las mismas herramientas que cuando analizamos el cambio de entranador, me puse a verificar si lo que MARCA afirmaba era cierto o no. Y estas son las conclusiones:

Analizando los goles a favor:


En el gráfico podemos ver que las dos 'cajas' que identifican las distribuciones de goles del Real Madrid con CR9 en el campo y sin él, tienen una separación evidente. Esta diferencia visual, que se ve claramente en el gráfico, se traduce en una diferencia estadística real y el 2 Sample T-Test así lo indica.

Analizando los datos de los goles en contra, la cosa cambia:


Aquí la distribución de los dos conjuntos de datos no es tan diferente. Las 'cajas' se solapan y esto hace que, aunque existe una diferencia entre medias, estas no sean lo suficientemente grandes como para que sean estadisticamente significativas.

Así que las diferencias que MARCA indica, son reales, pero sus conclusiones no lo son tanto. El Real Madrid marca menos goles sin Cristiano Ronaldo que con él, esto es cierto y estadisticamente esa diferencia es significativa. Pero en cuanto a los goles recibidos, aunque existe una diferencia también, estas diferencias no son lo suficientemente grandes como para decir que sean debida al factor CR9.

Bueno pues ya vemos que cada uno usa las estadísticas como quiere, y saca las conclusiones que le apetecen, unas con más valor que otras. Por eso yo, como norma general, no me suelo creer ninguna estadística que me llegan con conclusiones tan 'llamativas' como las que hemos visto y con tan pocos datos detrás para corroborarlas.

¿Ha cambiado el Madrid su estilo de juego?

Desde el día 9 de Diciembre pasado, Juande Ramos se hizo con las riendas del Real Madrid sustituyendo a Bernd Schuster al frente del equipo. Es claro que cada entrenador tiene unas características particulares y le gusta un tipo de juego determinado. Cuando dirigen a un equipo, cambian jugadores, el esquema de juego, la disposición del equipo en el campo, o el tipo de juego. Todo con el fin de imprimir su sello particular en el equipo.

Esto podría ser una buena base para el comienzo de una tertulia después de una buena comida con los amigos, pero, ¿se podrá demostrar estadísticamente?. ¿Será posible demostrar que el Madrid de Juande tiene un estilo de juego diferente al de Schuster utilizando la estadística?. Pues a ello vamos en esta entrada.

Para hacerlo vamos a utilizar dos variables, los goles que ha marcado el Real Madrid y los que ha recibido en los partidos dirigidos por uno y otro técnico.

GOLES A FAVOR:


En el gráfico podemos ver los goles que ha marcado el Real Madrid en los dos períodos. A la izquierda tenemos los goles marcados con Juande como entrenador y a la izquierda los marcados con Schuster. Se puede apreciar que las líneas medias (lineas en verde) son bastante similares, con Schuster habían marcado una media de 2.36 goles por partido y con Juande ese valor baja hasta los 1.57. Hay una diferencia de casi 0.8 goles por partido a favor de Schuster, pero esta diferencia no es lo suficientemente grande como para que sea significativa en un test 2-Sample T test. Dejaremos la explicación de este test para futuras entradas.

GOLES EN CONTRA:


Si analizamos los goles en contra las diferencias se agrandan. Con Schuster el Madrid recibía una media de 1.71 goles por partido, mientras que con Juande el equipo defiende bastante mejor y encaja una media de 0.43. Bastante más de 1 gol menos de media por partido. Esta diferencia, utilizando el mismo test, SI ES SIGNIFICATIVA con un nivel de significación del 95%. Lo que quiere decir que es bastante improbable que esta diferencia entre las medias sea debida al azar, una racha de buena suerte, la disposición de partidos en el calendario, etc.

Con esto se puede concluir que Juande ha cambiado el estilo de juego que tenía el Madrid de Schuster y ahora son un equipo que defiende mejor y al que es más difícil hacerle un gol.

Así que la siguiente vez que alguien os plantee la típica pregunta de ¿para qué sirve la estadistica? podeís decir sin ningún temor a equivocaros, que sirve para comprobar que el Madrid de Juande defiende mejor que el de Schuster. Y quedareis como unos campeones.

Reto Primera División: Picks Jornada 22

Comenzamos esta semana también con otro reto. Este, a diferencia de el de la NHL, haremos dos tipos de gestión de nuestro bank, el primero con un stake plano a partidos individuales y el segundo jugaremos una combinada de todos los partidos seleccionados con una gestión del bank tipo martingale. En concreto usaremos una serie de Fibonacci empezando por 1 ud. Al final de la liga analizaremos los resultados

Picks 07/08-02-09


Picks Primera
Resultados:

Resultados Reto

Resultado Picks Liga Campeones

Ayer me vino justo analizar los tres partidos y colocar los picks antes de que comenzasen, pero mereció la pena, 2 de 3 aciertos a esas cuotas es para estar contento. Para los picks de ayer utilicé los datos de Soccerway que me permiten analizar bastante más partidos que los 6 ofrecidos por Bwin.

Tomé todos los partidos de cada equipo en competiciones oficiales desde el comienzo de la liga. Y fui anotando el primer evento de la primera parte, como ya he explicado. Al final el resultado es una tabla en la que comparamos las cuotas reales con las previstas:



Como se puede ver las cuotas ofrecidas para los goles de los dos partidos acertados eran superiores a las teóricas, por eso las seleccionamos para los picks. En el partido del Mancherster volvía a aparecer la cuota de Sustitución muy por encima de la cuota teórica. De 42 partidos analizados en 9 de ellos el primer evento había sido sustitución, así que la cuota teórica es 42/9 = 4,67 muy inferior al 13 ofrecido. Esta cuota la debemos acertar una de cada 5 veces aproximadamente, si está bien calculada la probabilidad, con lo que el fallo entraba dentro de lo posible. Era una apuesta arriesgada pero con un poquito de suerte, es probable que podamos 'cazar' una de estas cuotas altas en próximos eventos.

Incluso con este fallo nos ponemos en positivo en el reto y seguimos acumulando datos en nuestra base de datos para hacer mas fiables las predicciones.

Nos vemos en próximas rondas de la Champions League.

*********** RESULTADOS DEL RETO ***************
Picks totales: 8
Aciertos: 4 (50%)
Uds apostadas: 43 uds.
Beneficio/ Pérdidas: +10.13 uds.
***********************************************

Picks Liga Campeones

Siguiendo lo que comentabamos en el otro post de picks vamos a seleccionar para hoy lo siguiente:

  • Partido Fiorentina - Bayern: Gol 5 uds @ 2.75
  • Partido R. Madrid - Juve: Gol 5 uds @ 2,65
  • Partido Celtic - Manchester: Sustitución 5 uds @ 13
No me extiendo más que no hay demasiado tiempo. Mañana comentaremos los picks y los resultados.

Un saludo

Resultados Picks Champions League

Ayer me resulto imposible conectarme, como dicen en la tele, por causas ajenas a mi voluntad, con lo que perdimos la oportunidad de seguir estudiando la estrategia de picks de la Champion League.

El resultado del martes no fue todo lo bueno que hubiese querído basicamente por dos motivos. El primero porque en los partidos que apostamos a la tarjeta como primer evento se dieron goles muy tempraneros, 4' para el Bayern (tarjeta a los 29') y 8' para el Steaua (tarjeta a los 19'). En ambos casos faltó un poquito de suerte, y el segundo fue la selección del stake por el criterio de kelly. Como había comentado en mismo post, 6 partidos es probable que no sean suficientes para estimar las tendencias de cada uno de los eventos y no contento con eso, no solo selecciono picks sino que tambíen asigno stakes tomando las probabilidades calculadas con los datos de los 6 partidos. De esta forma le estoy dando mucho peso a un dato que todavía no se si será correcto. Así que para el resto del reto asignaré un stake plano de 5 uds a cada pick.

Tras los picks del martes el reto queda de la siguiente forma:

Picks totales: 5
Aciertos: 2 (40%)
Uds apostadas: 28 uds.
Beneficio/ Pérdidas: -1.88 uds.

Con el stake plano no hubiesemos tenido pérdidas.

Para los siguientes picks del reto, me guardaré los datos de los 6 partidos que he tomado esta vez y así iremos incrementando la base de datos de partidos analizados, con la esperanza de mejorar en nuestras predicciones. A ver si hay más suerte la próxima vez.

Picks Liga Campeones

Esta semana vuelve la champions y entre la gran cantidad de apuestas que ofrecen las casas para estos partidos encontramo las apuestas a eventos en escala nominal como los que vimos en el ejemplo de hace un par de post. Así que a modo de repaso y para ver su funcionamiento vamos a utilizar el mismo criterio que empleamos allí para seleccionar posibles apuestas.

Recordemos los pasos:

1. Buscamos los datos de los 6 ultimos partidos para cada equipo que ofrece Bwin
2. Anotamos el primer evento de los ofrecidos para cada uno de los partidos
3. Hacemos un resumen de estos datos
4. Evaluamos la probabilidad de cada evento y calculamos su cuota teórica esperada
5. Comparamos la cuota esperada con la ofrecida por la casa y seleccionamos aquellas apuestas en las que la cuota esperada es menor que la ofrecida.

Con esto tenemos lo siguiente (he seleccionado estos partidos por cuestión de tiempo, no doy para más):



Y seleccionamos como picks:

  • Partido Bayern - Fiorentina: Tarjeta amarilla 9 uds @ 1.75
  • Partido Juve - R. Madrid: Gol 5 uds @ 2.75
  • Partido Manchester - Celtic: Sustitución 2 uds @ 13
  • Partido Fenerbahce - Arsenal: Gol 4.5 uds @ 2.75
  • Partido Steaua - Olympique: Tarjeta amarilla 7.5 @ 1.75

El stake lo he hecho siguiendo el criterio de kelly

Los sombreados en amarillo también cumplen ell criterio de ser mayor la cuota ofrecida que la teórica, pero el problema que tienen es que hay muy pocos partidos para confirmar esa discrepancia entre cuotas y los he dejado en 'cuarentena'.

El sistema teoricamente ha de funcionar a largo plazo, así que lo mantendremos para los partidos de la Champion League a ver como evoluciona. El único pero que tiene es que suponemos que los últimos 6 partidos de cada equipo son un buen estimador de las probabilidades de los eventos que estamos analizando, cosa que probablemente no sea del todo cierta. Así que recomiendo no seguir los picks hasta tener datos suficientes para comprobar si el sistema funciona o no.

Por otro lado, después de analizar los partidos de hoy, parece que la casa coloca las cuotas de manera genérica, con muy poca variación de un partido a otro. Esto puede jugar a nuestro favor porque hay partidos en los que las cuotas de un partido standard no se ajustan demasiado bien, como es el caso del partido Juventus - Real Madrid. Para el Madrid en 5 partidos de los 6 analizados, el primer evento ha sido un gol, y solo en 1 ha habido una tarjeta. Sin embargo en los partidos de la Fiorentina, en TODOS el primer evento ha sido una tarjeta.

Veremos lo que pasa hoy y mañana seguiremos.

La distribución de Poisson: Test de ajuste

En esta segunda entrega sobre el uso de la distribución de Poisson para predecir resultados de partidos de Futbol vamos a exponer como podemos comprobar si nuestros datos se ajustan a este tipo de distribución o no. Esto se conoce en estadística como test de bondad de ajuste o, en inglés, goodness of fit test.

Este proceso que vamos a explicar se puede utilizar con cualquier tipo de variable en escala nominal u ordinal y sirve para cualquier tipo de distribución.

El test está basado en la distribución chi cuadrado () y fue creado por uno de los más reputados estadísticos de los últimos tiempos, Karl Pearson. Su base, como en todos los test de hipótesis, consiste en establecer dos hipótesis, la hipótesis nula que considera que los datos que tenemos se ajustan a una determinada distribución y la hipótesis alternativa que es la negación de la nula, es decir, nuestros datos no se ajustan a la distribución. Dicho así no parece muy claro, pero es como se suele explicar la teoría. Traducido al cristiano sería algo así: Tenemos unos datos que 'parece' que siguen una determinada distribución, pero hay unas diferencias entre los datos que tenemos (observados) y los que deberían de ser (esperados). ¿Son esas diferencias lo suficientemente grandes para que sean provocadas por el azar?. La respuesta a esta pregunta la obtendremos con el test de bondad de ajuste.

Alguno a estas alturas se estará preguntando, ¿pero para que necesito hacer esto, si saco la media y lo meto en la fórmula de Poisson y obtengo el resultado que necesito?. La respuesta es sencilla, si nuestros datos no siguen la distribución de Poisson, todas las predicciones que hagamos utilizando las fórmulas para esta distribución serán erroneos y si nos basamos en ellos para apostar, tenemos muchas posibilidades de ver numeros rojos en nuestro bank a final de temporada.

Después de este pequeño paréntesis económico, vamos a ver como podemos realizar el test de bondad de ajuste a una distribución de Poisson en Excel.

Para ello tomaremos los datos del total de goles marcados por partido en la primera división durante la temporada 2007-2008. Pulsando sobre estadísticas tendremos el resumen de los datos que necesitamos. Estos serían nuestros valores 'Observados'. El siguiente paso que debemos hacer es calcular la media de los goles totales marcados por partido. Al tener los datos resumidos no podemos utilizar la función promedio() si no que debemos hacer una especie de 'desagrupamiento'. Esto, como siempre, se puede hacer de varias formas, yo voy a explicar dos de ellas, las más sencillas.

La primera es crear una nueva columna en la que multiplicaremos el número de goles por la cantidad de partidos (Columna C). Sumaremos todos esos productos y dividiremos este valor por el total de partidos jugados.

La otra es usar la formula sumaproducto(A2:A11;B2:B11) y nos ahorramos el paso de las multiplicaciones, que lo hace excel internamente. El resultado es el mismo para ambos casos, ¡Faltaria más!.

Una vez calculada la media, lo que hacemos es determinar los valores 'Esperados' según una distribución de Poisson con esa media. Esto lo calculamos multiplicando la probabilidad de Poisson para cada resultado, por el total de partidos.

La última columna la utilizaremos para calcular el estádistico con la siguiente fórmula:



Esta columna es importante, porque nos da información de donde se producen las mayores discrepancias. Cuanto mayor sea el valor que obtengamos, mayor es la discrepancia entre el valor observado y el esperado. Más alejado está ese punto de su lugar teórico predicho por la curva de Poisson y más probabilidad tenemos de que el resultado del test nos diga que nuestros datos no se ajustan bien a la curva.

Ya solo nos queda sumar todos estos valores y 'buscar' dentro de la función y comprobar si las diferencias que hemos encontrado son lo suficientemente grandes o no para rechazar o no rechazar la hipótesis nula. Ya veis que he dicho rechazar o no rechazar, en lugar de rechazar o aceptar, porque NUNCA se acepta la hipótesis nula. Este es un error muy común en la interpretación de los resultados de test de este tipo. Pero dejaremos esto para un futuro.

La función tiene dos parámetros, el primero de ellos es el valor de nuestra suma, y el segundo son los grados de libertad para los que vamos a calcular este estadístico.

Los grados de libertad se obtienen con la siguiente fórmula: GL = Nc - Np - 1

Siendo Nc = al número de categorías que tenemos y Np = número de parámetros que estamos estimando. Para nuestro caso tenemos 10 categorías y vamos a estimar un parámetro solo que es la media: GL = 10 - 1 - 1 = 8

El valor que nos devuelve es lo que en estadística se llama P-Value, y corresponde a la probabilidad de equivocarnos si rechazamos la hipótesis nula. Como norma general se suele tomar como valores de corte el 5% ó el 1% dependiendo de lo restrictivos que seamos. Este valor lo debemos de tomar ANTES de la realización del test y será nuestro límite para rechazar o no rechazar la hipótesis nula.

En el ejemplo tenemos un P-Value de 0.54 con lo que debemos decir que las diferencias que hemos encontrados no son lo suficientemente grandes como para decir que nuestros datos no siguen una distribución de Poisson. Como esto es un poco engorroso, hay mucha gente, que viendo este P-Value, adopta una postura más comprometida y llega a decir que nuestros datos siguen una distribución de Poisson. Pero como ya he explicado esto no es del todo cierto, puede que siga una distribución de Poisson o puede que se acerquen más a otro tipo de distribución. El aspecto final de la hoja sería el siguiente:



Como no quiero extenderme más, solo hago una puntualización final. Si os fijais tenemos dos categorías con menos de 5 datos (8 y 9 goles), siendo estrictos deberíamos haber agrupado estas dos categorías y crear una nueva como más de 6 goles, agrupando en ella las categorias 7, 8 y 9 goles. El resultado del test varía poco en este caso, así que para no complicar más la explicación lo he dejado así. Si alguno está interesado en como se haría el test en este caso que lo diga y lo explicaremos.

Un saludo y hasta la próxima

EDITO 22/07/10: Al final he encontrado una forma de añadir hojas de cálculo al blog y he creado una mini hoja Excel para calcular los resultados de un partido de Futbol a partir de la media de goles marcados por cada equipo. La hoja la teneís aqui.

La distribución de Poisson

La distribución de Poisson lleva el nombre de su descubridor que la publicó en 1838, junto con su teoría de probabilidad en su trabajo Recherches sur la probabilité des jugements en matières criminelles et matière civile ("Investigación sobre la probabilidad de los juicios en materias criminales y civiles"). En un primer momento, la utilizó para predecir el resultado de las votaciones de los jurados en un veredicto. A partir de ahí, su uso se extendió a la ciencia de la artillería y actualmente se usa en multitud de situaciones, como, número de fallos en un proceso productivo, cantidad de llamadas telefonicas recibidas en un periodo de tiempo, número de bacterias en un especímen determinado, cantidad de estrellas en un volumen de espacio, numero de mails recibidos al dia, número de goles marcados en un período de un partido de la NHL e incluso, en 1898, se utilizó para determinar la probabilidad de que un soldado del ejército Prusiano muriese a consecuencia de la coz de su caballo.

La distribución de Poisson es una distribución se utiliza para modelizar eventos discretos. Eventos en los que sus resultados solo pueden ser números enteros mayores o iguales a 0. En un partido de fútbol no se pueden marcar 3.2 goles ni en una hora se pueden recibir 12.7 llamadas por teléfono. Esto no quiere decir que un equipo no pueda marcar una media de 3.2 goles por partido y una operadora no pueda recibir una media de 12.7 llamadas a la hora. Son dos cosas diferentes, una es el resultado de un determinado evento (un partido de futbol), que siempre será un número entero mayor o igual a 0, y otra la media de los resultados individuales. No se deben confundir.

Se ha demostrado estadísticamente que la distribución de Poisson se ajusta relativamente bien para predecir el número de goles marcados en partidos de hockey. En el caso del fútbol el ajuste empeora un poco y muchos autores indican que para mejorar sus predicciones se debe realizar una corrección para resultados de 0 goles e incluso de 1 gol. Para este ejemplo nosotros utilizaremos la distribución sin ningún tipo de ajuste.

Su fórmula es la siguiente:

Prob(B=k) = exp (-m) x m^k / k!

Siendo m la media y k el número de eventos sobre los que estamos calculando la probabilidad. Y esta ecuación se lee como la probabilidad de que aparezcan k sucesos en un evento con media de apariciones m.

Veamos un ejemplo:

Supongamos que el Botijos F.C. ha jugado 20 partidos y ha marcado 28 goles. ¿Que probabilidad hay de que en el siguiente partido marque exactamente 1 gol?

La media de goles por partido es de 28 / 20 = 1,4 goles por partido

Ahora tenemos dos alternativas:

1. Ir al excel y colocar =Poisson(1;1,4;Falso)= 0.345 (esta función es para el Excel en castellano para los que tengan la configuración en ingles, el paréntesis quedaría, (1,1.4,False))

2. P(B=1) = exp (-1.4) x 1.4^1 / 1! = exp (-1.4) x 1.4 = 0.345

Es decir la probabilidad de que el Botijos FC marque un gol es de 34.5%

Si lo que queremos saber es la probabilidad de que el Botijos meta al menos un gol. También se puede hacer por dos caminos, pero voy a usar el excel que es el más rápido. Para hacerlo debemos usar el suceso complementario. No voy a explicar esto ahora porque me llevaría una buena parrafada, pero es así:

P(B>=1) = 1 - P(B=0)

P(B>=1) = 1 - Poisson(0;1,4;Falso) = 1 - 0.25 = 0.75 = 75%

Veamos ahora su aplicación al resultado de un partido. ¿Que probabilidad hay de que el partido sea under 1.5 si juega contra el Chinchorro FC, sabiendo que marca 2 goles por partido de promedio?

Para calcular esto, lo primero que debemos hacer es obtener el conjunto de resultados que cumplen en under 1.5. Son 3:

0-0, 0-1, 1-0

Calculamos ahora la probabilidad de cada uno de ellos y la probabilidad del under será la suma de todos ellos.

P(B=0, C=0) = Probabilidad de que el Botijos marque 0 goles x Probabilidad de que el Chinchorro marque 0 goles = Poisson(0;1,4;Falso) x Poisson (0;2;Falso) = 0.25 x 0.135 = 0.033

Es decir la probabilidad del 0-0 es de un 3.3%

P(B=0, C=1) = Poisson(0;1,4;Falso) x Poisson (1;2;Falso) = 0.25 x 0.41 = 0.1
P(B=1, C=0) = Poisson(1;1,4;Falso) x Poisson (0;2;Falso) = 0.59 x 0.135 = 0.08

P(Under 1.5) = 0.033 + 0.1 + 0.08 = 0.213 = 21.3%

Aplicando el mismo razonamiento del suceso complementario tendríamos que la probabilidad del over 1.5 sería de 1-0.213 = 0.787 = 78.7%

Siguiendo este mismo procedimiento se pueden modelizar todos los posibles resultados del partido para determinar, probabilidades de que gane el equipo de casa, empate, gana el equipo de fuera e incluso calcular la probabilidad de otras líneas de Over/Under, como la 2.5.

Solo un apunte final, en estos casos se suele calcular la probabilidad del resultado individual de 0, 1, 2, 3, 4, 5 y más de 5 goles. Para calcular esta última se hace también por el suceso complementario

P(B>5)= 1 - P(B<=5) y la P(B<=5) se calcula en excel de forma muy sencilla:

P(B<=5) = Poisson (5; media; VERDADERO)

El verdadero de la última parte de la fórmula indica que es una probabilidad acumulada, de 0 hasta 5. Justo lo que necesitamos.

Con esto acabamos este pequeño inciso sobre la distribución de Poisson. En diferentes entradas del curso básico analizaremos un poco más en profundidad algunos conceptos de esta entrada y veremos también otro tipo de distribuciones muy utilizadas como puede ser la distribución normal. Hasta entonces un saludo.

EDITO 22/07/10: Al final he encontrado una forma de añadir hojas de cálculo al blog y he creado una mini hoja Excel para calcular los resultados de un partido de Futbol a partir de la media de goles marcados por cada equipo. La hoja la teneís aqui.

En busca de sorpresas

Hace algunos meses se estuvo discutiendo en forobet a cerca de una estrategia que se basaba en buscar sorpresas en partidos de fútbol. El fútbol es uno de mis deportes vetados en las apuestas precisamente por esto, resultan 'demasiado' normal las sorpresas y, además, en muchas ocasiones los resultados de un partido no reflejan lo que ha ocurrido realmente durante los 90 minutos.

Por regla general la cantidad de goles anotados por los dos equipos suele ser bastante baja (las líneas Over/Under se suelen colocar en 2.5 goles), con lo que una decisión arbitral o una jugada de mala suerte pesan demasiado en el resultado final del partido. Así que cuando vi el tema me llamó la atención porque era otra forma de enfocar las apuestas en el fútbol.


Este nuevo planteamiento me hizo pensar y lo que hice fue analizar las cuotas y resultados de varias ligas europeas y calcular el resultado final de diferentes estrategias de apuestas en función de la cuota apostada. El resultado final fue este:



En el gráfico aparecen en el eje X las cuotas y en el eje Y los resultados de apostar una unidad en todos los partidos en que aparezca esa cuota o mayor. De él se pueden sacar cosas interesantes:
  • La Leage 1 y 2 dan beneficios apostando a toda cuota mayor de 2,7
  • France1 y Bundesliga dan beneficios a partir de 4,9 (el óptimo es 5,9), mientras que para la primera todo es negativo hasta las cuotas de 8 o mayores.
  • El resto de ligas (italiana y France2) no salen rentables.
En otro estudio similar que aparecía en el post se indicaba a la 1ª División de Bélgica como la liga mas indicada para apostar a las sorpresas o hacer lay a los equipos favoritos, seguida por las primeras divisiones de Francia, Inglaterra, Irlanda y Dinamarca. Estos resultados se obtuvieron a partir de análisis de la temporada 2007 y anteriores.

Sería interesante comprobar si se mantiene o si hubiese sido rentable aplicar esta estrategia a la temporada actual, pero no tengo esos datos. Si alguien lo comprueba que nos facilite el resultado en un comentario a este post.