Mostrando entradas con la etiqueta Estadística. Mostrar todas las entradas
Mostrando entradas con la etiqueta Estadística. Mostrar todas las entradas

El P-Value en las apuestas

Bueno, como comentaba en la anterior entrada, vamos con esta segunda parte en la que seguiremos hablando de los test de hipótesis y el P-Value, pero ahora centrado en el tema de las apuestas, que es el motivo por el que me planteé escribir estos dos post.

Ya vimos en la entrada inicial, que el P-Value se obtenía como resultado de un test de hipótesis con el que valorábamos las diferencias encontradas entre DOS variables. El P-Value nos da una indicación sobre la probabilidad de que esas diferencias que hemos encontrado al hacer el test sean reales o sean fruto del azar. Si las diferencias encontradas son muy grandes, el P-Value será muy pequeño y, por tanto, nos está indicando que la probabilidad de que esas diferencias sean fruto del azar es muy baja.

Hay una gran variedad de test de hipótesis y cada uno de ellos se debe usar en función de las variables o los datos que tengamos que comparar. Podemos usarlos para comparar si el cambio de entrenador en el Real Madrid ha influido en la cantidad de goles que anota y que recibe el equipo, como hicimos en este post, o si el rendimiento de un bateador de la MLB podría estar afectado por el color de sus ojos, o si el Real Madrid, en su época, tenía una cristiano-dependencia. En todos ellos los test de hipótesis se usaron para comparar dos situaciones diferentes y concluir si las diferencias entre ellas eran estadisticamente significativas o no. En algunos casos vimos que SI, que había unas diferencias importantes y los P-Value que obteníamos eran muy bajos, con lo que SI podíamos decir que, con un grado de confianza del 95%, esas dos situaciones eran diferentes, pero en otros casos no encontramos diferencias lo suficientemente importantes.

Lo mismo nos pasaba en la entrada anterior, donde hice el supertest UsainBoltiano y me comparaba con velocista jamaicano. El test prácticamente no encontró ninguna diferencia entre Usain y yo. Cuando pasa esto, NO PODEMOS DECIR que esas dos variables que comparamos sean IGUALES, es decir, no podíamos decir que yo soy Usain Bolt, y debemos decir que no hemos encontrado diferencias suficientes para poder asegurar que son distintas. En estas circunstancias, nuestro siguiente paso seria valorar la 'potencia de nuestro test'. Debemos confirmar, si nuestro test es lo suficientemente potente como para encontrar las diferencias que estamos buscando.

Este es el primer problema de los test de hipotesis, que SIEMPRE comparan algo para buscar diferencias, y si no se encuentran esas diferencias, tenemos que confirmar si no las hemos encontrado porque en realidad no las hay o no las hemos encontrado porque nuestro test era una castaña (como asi era en el test de Usain Bolt).

El segundo problema de los test de hipótesis es SABER QUÉ COMPARAMOS. Y aquí es donde entra el tema de las apuestas.

Hace unos meses me topé con un post en Twitter, que me dejó un poco mosca, en el que un tipster hablaba de sus resultados y del P-Value.  Y el remate final fue cuando vi este mensaje de la gente de Pyckio. En ese momento, me quede como un conejo cuando le dan las largas. Hacian un reto contra uno de sus mejores tipsters en el que el ganador se iba a valorar en función del P-Value. 

Me puse a investigar y descubrí que hay un fichero Excel creado por Miguel Figueres que introduciendo 4 datos te devuelve un P-Value. Este P-Value traducido al lenguaje apuestil representa la probabilidad de que los resultados de tu estrategia de picks se deba al azar. Fascinante!!!!.

Pues manos a la obra, voy a meter mis datos a ver que pasa, 975 apuestas, Yield de 0.5, Promedio ponderado de apuestas 3,5 y stake medio 1:


Le doy al enter.... y tras unos segundos de tensa espera, aquí tengo mi resultado:


P-VAlue de 0,000%, eso no lo supera ni el super tipster de Pyckio, soy un TOTAL PRO!!!. Con estos datos estoy seguro que la gran mayoría de vosotros seguiríais mis picks a ciegas. Pues craso error.  Esos picks han sido, 974 apuestas a cuota 2 con stake 1 en la que solo he acertado UNA!!! y, como ya estaba hasta las narices de perder, tras 974 apuestas hice la apuesta 975, que fue una megacombinada a  cuota 1500 y me tocó la lotería, como al finlandés con el podio de la F1 en Monza hace unos dias. Mas azar que esto no puede haber en una estrategia de apuestas, y sin embargo el resultado de los cálculos de fichero me dice que NO, que mis resultados no pueden ser por suerte. ¿Como se explica esto?.

Pues muy fácil, el test que hace el fichero es un test en el que se comparan los resultados de mis apuestas con una función que podemos llamar apuestas medias ponderadas, en mi caso, los resultados de mis apuestas no se parecen ni por lo más remoto a esa función, con lo que el P-Value es enano. ¿Quiere decir eso que mis resultados no han sido fruto de la casualidad?, PUES NO, NO y MIL QUINIENTAS VECES NO. Lo que quiere decir es que los resultados de mis apuestas no se parecen en nada a la función con la que lo comparo y punto.

Así que sintiéndolo mucho, por ahora no he encontrado a nadie que tenga la varita mágica del P-Value en las apuestas, sencilla y llanamente porque NO SE PUEDE MODELIZAR LOS RESULTADOS DE LA FUNCION AZAR que serían los que tendríamos que comparar con nuestras apuestas.

Podría haber un caso en el que se podría hacer algo pero eso lo dejo para otro post, si a alguno de vosotros os interesa.



Los Test de Hipotesis, el P-Value y Usain Bolt

Usaint
Hace algunos años, en este post, explicaba cómo se podía hacer un test de normalidad en Excel y en él hacía mención a lo que en estadística inferencial se llama el p-value. El p-value, como su propio nombre indica, es un 'valor' que se obtiene como resultado de un test de hipótesis, en el que se suele plantear una disyuntiva entre dos alternativas. 
Voy a intentar ser lo más elemental posible en este post para que se pueda entender de manera fácil. 
Imaginemos que lo que queremos analizar es si yo soy Usain Bolt o no. Para ello haremos un test en el que planteamos dos hipótesis:
  • La hipótesis nula (H0) sería que yo soy Usain Bolt
  • La hipótesis alternativa (H1) sería que no lo soy
 Ahora nuestro test de hipótesis lo que hace es: 
  • Vale, voy a darte el beneficio de la duda y vamos a partir de la base que SI lo eres. Ahora voy a usar mis métodos para intentar encontrar pruebas (diferencias) y dependiendo de lo grandes que sean esas diferencias te diré si deberías rechazar H0 o no.  ¡¡OJO!!, no digo aceptar, digo rechazar o no, la explicación a esto la veréis más abajo.
Bien, pues vamos con nuestro test que pretende encontrar esas diferencias. El test consiste en las siguientes 10 preguntas:
  1. ¿Eres hombre?
  2. ¿Eres negro?
  3. ¿Tienes dos piernas?
  4. ¿Has asistido alguna vez a unos juegos olímpicos?
  5. ¿Tienes hermanos?
  6. ¿De pequeño jugabas al futbol?
  7. ¿Te gustaría jugar en el Manchester United?
  8. ¿Te gusta la música?
  9. ¿Juegas al dominó?
  10. ¿Has corrido alguna vez la prueba de 1500 m?
 Las respuestas a esas preguntas si se las hiciésemos a Usain serían todo Sies menos la última que es un No.
Si me las hago a mí, la respuestas son todo sies menos la segunda y la última.
Es decir que el 90% de mis respuestas coinciden con las de Usain. Este test, no ha conseguido encontrar practicamente ninguna diferencia entre Usain y yo. Con estos resultados, el p-value que obtendríamos estaría bastante por encima del 0.05 que suele ser el valor de corte utilizado para rechazar o no la hipótesis nula.
A la vista de estos datos, MUCHA GENTE diría, como el p-value es mayor que 0.05 (lo que se denomina nivel de significación) aceptamos H0 como válida, lo que equivale a asegurar que SOY USAIN BOLT.
Lamento decepcionaros, pero evidentemente no lo soy.
Uy, pero entonces, ¿Que ha pasado?. Pues muy fácil, mi test es tan sumamente malo que no encontraría diferencias significativas entre cualquier hombre de este país y Usain Bolt. Así de sencillo.
Cuando obtenemos este tipo de resultados en un test de hipótesis, EN LUGAR DE ACEPTAR H0, lo que se DEBE DECIR es que no hemos encontrado diferencias suficientes para RECHAZAR H0 y lo que nos debemos plantear en este caso es si nuestro test es suficientemente potente como para encontrar esas diferencias. Como todos vosotros coincidiréis y viendo esta patata de test, la respuesta a la pregunta es un rotundo NO.
Cualquiera de vosotros puede encontrar otra batería de 10 preguntas, o de menos incluso, que permita identificar, con una certeza casi absoluta, si la persona que responde al test es o no es Usain Bolt. He de reconocer que me ha costado encontrar 10 preguntas para hacer el chapuza test este, buscando información sobre Usain hay miles de cosas que preguntar que nos distinguirían de inmediato entre uno y otro.
Como no quiero hacerlo muy largo, por hoy, lo dejamos aquí y en el siguiente post veremos la relación entre el p-value y las apuestas, que es algo que en Twitter está muy de moda.

Estudiar el pasado puede definir el futuro - Parte 2

7 días después estamos de vuelta para completar el post que inicié el fin de semana pasado. Como recordáis tomamos los datos de la web European Centre for Disease Prevention and Control para hacer las predicciones y los gráficos que os muestro en estas dos entradas.

La pregunta que lanzábamos hace una semana era, ¿Se puede predecir el comportamiento de la evolución de casos en los distintos países?. Vosotros mismos la vais a poder responder si continuáis leyendo. La zona sombreada en amarillo son los datos nuevos de esta semana.

  • Italia

A Italia la dejamos en su día 27 y su gráfica merece un optimismo moderado, se ha ido despegando de la curva ajustada y da señales de una bajada en la cantidad de contagios, lo que es una buena señal.

  • ALEMANIA

A Alemania la dejamos en su día 22 y la evolución es positiva, como en Italia, su gráfica en azul (casos reales) se va alejando de la curva de ajuste. Buena señal también.

  • CHINA

China llevaba mucha ventaja al resto de países en la gráfica, y como podéis ver sus casos reales se han estabilizado por completo. Todas sus acciones han dado resultado y se puede decir que la pandemia en este país está bajo control.

Y ahora vamos con nuestros campeones

  • ESTADOS UNIDOS
Su maravilloso presidente, pasó olimpicamente de aprender de lo que estaba sucediendo en otros países y no tomó ninguna medida. Hace una semana dijimos que en 7 días superarían los 100.000 infectados, y en siete días se plantaron en 104.000, hoy van por los 124.000 y subiendo religiosamente pegados a su curva de predicción, aunque, hay que decirlo, por debajo de ella. Dentro de lo malo lo menos malo.

  • ESPAÑA

 Y por último ¿que ha hecho España?, pues salirse, como una campeona!!
Como nuestros compañeros los yankis seguimos nuestra peregrinación por la curva de predicción, pero, no conformándonos con eso, la mejoramos!!!. Y nuestros gobernantes diciendo que ya se ven indicios de mejora en alguna comunidad. Es increíble. El hormigón armado que se gastan nuestros y políticos en su rostro, para sí lo querrían muchas de las constructoras que estos días van a tener que dejar a toda su plantilla en casa.

Si vamos a las previsiones hechas hace una semana este es el resultado:

Dia Pred Real Error Porc (%)
Domingo 24160 24892 732,0 3,0%
Lunes 28630 28538 -92,0 -0,3%
Martes 33680 33055 -625,0 -1,9%
Miércoles 39370 39639 269,0 0,7%
Jueves 45730 47576 1846,0 4,0%
Viernes 52824 56154 3330,0 6,3%
Sábado 60700 64025 3325,0 5,5%

Hasta el pasado miércoles íbamos copiando la curva casi al pie de la letra, pero los tres últimos días hemos despegado. Yo lo dejo aquí porque se me puede ir la tecla y soltar algún improperio.

Señores.... disfruten lo votado.

Estudiar el pasado puede definir el futuro - Confucio

Hace tiempo que tengo el blog abandonado por razones varias, pero el momento actual creo que bien merece una entrada nueva. Estamos viviendo una situación excepcional, que nos marcará y recordaremos durante toda nuestra vida y me duele en el alma que ver como se colapsan hospitales, como se incrementa día tras día el número de victimas ante la pasividad o lentitud en la toma de decisiones.

En esta entrada no voy a hablar de apuestas deportivas, obviamente no estamos en el tiempo ni el lugar para ello, lo que voy a plantear es la necesidad de estudiar y aprender, de analizar datos, de hacerse preguntas y de buscar soluciones.

Todos los datos que he utilizado los podéis encontrar en la web del European Centre for Disease Prevention and Control, desde donde se puede descargar un fichero Excel con toda la información sobre casos detectados y fallecidos por la pandemia del COVID-19.

No me enrollo mas y comenzamos. Como muchos de vosotros ya sabréis este virus es especialmente peligroso por la tasa de contagio que tiene. La OMS estima que esta tasa de contagio (R0) oscila entre 2 y 3, lo que significa que cada persona contagiada con el virus puede a su vez contagiar a 2 ó 3 personas más. Para que nos hagamos una idea, la gripe, por ejemplo, tiene una tasa de 1.5.

Esta tasa de contagio no es fácil de calcular pero, vamos a intentar estimarla con los datos facilitados por el ECDC para varios países, en concreto, China, Italia, Alemania, España y Estados Unidos.

El día 1 en los gráficos corresponde al primer día en el que los casos acumulados superan los 20 contagiados.

Empezamos con nuestros vecinos Europeos.
  •  ITALIA:

La gráfica azul representa los datos reales mientras que la naranja son los datos ajustados a una función exponencial cuya expresión es:


Donde x es el numero de días transcurridos, c es una constante para ajustar el punto inicial de la curva y b es lo que podríamos llamar el ratio de contagios. El ajuste de la curva como podéis ver es prácticamente perfecto (lo he hecho en Excel usando el Solver, por no alargar el post no pongo aquí todo el desarrollo).

Para Italia estas tres variables toman los siguientes valores:
c=1495.73 a=0.19 y b=3.76
  • ALEMANIA

El ajuste en este caso no es tan bueno, pero vemos que también sigue una curva exponencial cuyos parámetros son: c=0 a=0.0031 y b=5.02
Lo más llamativo de este caso es que el valor del ratio de trasnsmision ha subido a 5.02 que hará que el ascenso de los casos será mucho más acentuado.

Y en ESPAÑA, ¿COMO ESTAMOS?

  • ESPAÑA
Pues tenemos un ajuste prácticamente perfecto, y nuestros parámetros son:
c=28.88 a=0.18 y b=3.82
Estos datos son practicamente CALCADOS a los de Italia, aunque nosotros estamos en el dia 21, mientras que ellos están en el 28. ¿que quiere decir esto? pues que SI NO HACEMOS NADA MAS, las previsiones para los próximos dias son (hoy estamos a Domingo 22 de Marzo de 2020): Domingo 24160, Lunes 28630, Martes 33680, Miércoles 39370, Jueves 45730, Viernes 52824, Sábado 60700

Espero equivocarme, pero, como dicen en el anuncio... yo ahí lo dejo.

Nos quedan ver dos paises importantes.

  • ESTADOS UNIDOS

Otro ajuste impecable, pero este MUCHO MAS PELIGROSO, ya que sus parámetros son: c=0 a=0.0003 y b=6.03. 
La falta total de coordinación y medidas contra el virus va a hacer que su crecimiento sea mucho más acentuado que en Europa, y el modelo predice que dentro de 7 días el número de infectados superará los 100.000


  • CHINA
El modelo predice prácticamente sin fallos desde el dia 1 al 22 (mas o menos donde estamos nosotros ahora) con parámetros c=0 a=3.42 y b=3.00 muy parecidos a los de Italia y España. Pero a partir del dia 22 la cosa cambia.

La gráfica empieza a desviarse de la predicción y sobre el dia 30 comienza a aplanarse. SEÑORES DEL GOBIERNO, hagan el favor de averiguar que hizo CHINA en esos días previos y COPIEMOS la estrategia para parar este terrible goteo diario de muertes.

Este POST tendrá otro de continuación dentro de una semana, cualquier comentario es bienvenido. Hasta entonces, cuidaos mucho y espero volveros a ver a todos dentro de 7 días.

El poder de las pequeñas cosas

Son muchas las personas que me han contactado y siguen contactando para pedir ayuda a la hora de calcular las probabilidades de los posibles resultados de un partido. La mayoría de ellos lo hacen después de haber leído la entrada referente a la distribución de Poisson y su aplicación al futbol. Allí explicamos como mediante una simple fórmula se puede realizar una aproximación a la probabilidad real de los resultados de un partido. Esto tiene su parte buena y su parte mala. La buena es que con sólo un par de datos (goles a favor del equipo de casa y del equipo de fuera) se puede calcular una probabilidad, que, debido a lo simple del método, no siempre resultará cierta. Esta es la parte mala.

Si tomamos esta base como único pilar para nuestra estrategia de apuestas, lo tenemos realmente difícil para salir en verde a largo plazo. Estamos intentando crear un modelo de predicción de un evento realmente complejo, como es un partido de fútbol, usando únicamente dos parámetros. En el resultado final del partido intervienen infinidad de variables que nuestro modelo no tiene en cuenta y al que afectarán en mayor o menor medida.

Muchas de estas varibles pueden resultar ridículas a primera vista, y mucha gente no las tendría en cuenta. Existen jugadores de futbol que saltan al terreno de juego pisando siempre con un pie determinado, otros lo hacen justo en la tercera posición, otros tocan el cespéd... también en el tenis se pueden encontrar actuaciones similares, hay algunos tenistas que intentan no pisar las líneas, o sacar siempre el primero, cambian la raqueta al cabo de 8 juegos o botan la pelota 8 veces antes de sacar. Todas estas variables normalmente no se tienen en cuenta en los modelos de predicción pero, por increíble que parezca, pueden llegar a tener influencia en el resultado. Esta influencia puede lleagar a ser demostrada mediante test estadísticos. Aquí hemos usado ya test similares para analizar la influencia de jugadores o entrenadores en la cantidad de partidos ganados o la cantidad de goles marcados.

Este verano en uno de mis devaneos por la red, andaba yo buscando información sobre la MLB y me llevé la sorpresa de que existe un foro en español sobre el tema, en el que además existe un apartado sobre sabermetrics. En este foro se planteó si el rendimiento de un bateador podría estar influenciado por un factor que resulta realmente llamativo: el color de sus ojos.

La historia comenzó cuando Josh Hamilton, bateador de los Texas Rangers, comentó que le resultaba mucho más complicado batear en los partidos jugados durante el día que en los que se jugaban por la noche. Sus números así parecen indicarlo:


De día le han realizado 49 lanzamientos, con los siguientes resultados:
  • Bateados: 6
  • HR: 0
  • RIB's: 4
  • Walks : 8
  • SO: 17
  • OPS: 0.429

Con luz artificial le han realizado 109:
  • Bateados: 41
  • HR: 6
  • RIB's: 28
  • Walks : 7
  • SO: 14
  • OPS: 1.076.

Con estos datos se puede demostrar estadísticamente que para este bateador los efectos de la luz natural tienen efectos negativos en su juego. Todos los test realizados sobre los parámetros anteriores tienen significación estadística, esto quiere decir, que con un 95% de probabilidad podemos rechazar que las diferencias sean debidas al azar.

Usando estas mismas variables se podría ampliar la hipótesis a todos los lanzadores con ojos claros e intentar demostrar que siempre tinen mejores números con luz artificial, que con la luz de día. No sería difícil, si alguien se molesta en recoger los datos lo podemos hacer. Por lo pronto Josh ha decidido jugar los partidos diurnos con unas lentillas de color... rojo!!. ¿Será esto suficiente para ver mejorar su rendimiento?, pronto lo veremos... y nunca mejor dicho.

Pitágoras y la MLB

Este filósofo, pensador y matemático griego da nombre a uno de los teoremas más conocidos de las matemáticas: El Teorema de Pitágoras, aunque, paradójicamente, no se le puede atribuir ni él ni tampoco a su escuela su descubrimiento. En civilizaciones mucho más antiguas como la babilónica, la hindú o la egipcia, ya eran conocidas las llamadas ternas pitagóricas: tríos de números que cumplen con este teorema.

Una de las más famosas, la terna 3-4-5, era denominada por los egipcios 'el triángulo sagrado' y la pirámide de Kefrén, por ejemplo, fue construida basándose en ella. Su lado mide 412 Codos y su altura estimada en la época de su construcción era 275 Codos. La relación entre la semi-base de la pirámide (412 / 2 = 206) y la altura 275 es de 3/4 (206 / 275 = aprox 0.75 = 3/4).

Por increíble que parezca, también tenemos referencias a esta fórmula en el mundo de las apuestas. Un estudioso de la MLB llamado Bill James, descubrió hace unos 30 años, que había una relación entre las carreras concedidas y anotadas por los equipos de la MLB y su porcentaje de victorias. Esta relación la expresó como:


Debido a la similitud de esta fórmula con el teorema de Pitágoras, en el que todos sus valores también aparecen elevados al cuadrado, la denominó el teorema de Pitágoras para el beisbol.

A partir de aquí otros muchos investigadores han intentado aplicar el mismo concepto de fórmula para otros deportes y así se ha llegado a la misma fórmula en la que los doses se sustituyen por los siguientes factores:

NFL: 2.37

NCAA Basketball:10

NBA: 14


La finalidad de esta fórmula es predecir cual sería el porcentaje teórico de partidos ganados en función de los puntos anotados y recibidos. Esto puede ser de gran interés para el apostante. Este valor teórico se puede comparar con el real y en consecuencia se pueden determinar equipos que sus valores reales están 'desajustados' frente a las predicciones. Si la realidad refleja un valor inferior al teórico se supone que ese equipo debe mejorar en un futuro y el % de victorias debe ser superior al que ha obtenido hasta ese momento, por el contrario si el valor real es superior al teórico, tenemos a un equipo 'sobrevalorado' y sus resultados deberían ser peores en un futuro.

En la temporada 2006-07 los Miami Heats tenían una media por partido de 94.6 puntos anotados frente a 95.5 recibidos. Su porcentaje de victorias esperadas era del 47% frente al 54% (44-38) que llevaban durante la temporada. En los play-offs cayeron estrepitosamente 4-0 frente a Chicago.

Algo similar le sucedió a los Dallas Mavericks, que comenzaron los playoffs con un 74% teórico frente a un 82% real. También fueron eliminados en la primera ronda de los playoffs.
San Antonio Spurs se presentaban a los playoffs con un panorama radicalmente diferente: un 71% de victorias reales frente a las 78% esperadas. Los números parecían indicar que los Spurs, no lo iban a hacer mal en los playoffs, y así fue, resultaron los ganadores de ese año y en los play offs consiguieron un registro de 16 partidos ganados frente a 4 perdidos (80%).

Otros ejemplos como estos se pueden encontrar analizando otras ligas y otras temporadas, y la idea sigue siendo la misma, estimar un nuevo parámetro que nos permita añadir un factor más al análisis de nuestros picks. Ahora es responsabilidad de cada uno ajustar su peso en la decisión final. Tanto si es alto como si es bajo, confío que os sea útil de alguna manera.

Cálculo de probabilidades de Poisson

Hace cosa de unos quince días, en una de mis visitas rutinarias al blog, me llevé la sorpresa de que había más de 40 visitantes online. Pensé que sería un error del contador pero resultó ser que no, en dos días recibí más visitas que en todo un mes, y todo ello debido a que Mr. Lucky, un colaborador de Marca, me había enlazado la página en la que hablaba de la distribución de Poisson.

Como agradecimiento había pensado colocar una especie de formulario en el blog para que los visitantes pudiesen calcular de manera sencilla las probabilidades por Poisson de un partido partiendo de la media de goles de los dos equipos.

Al final he conseguido mediante Javascript una especie de formulario que funciona correctamente, pero no se como insertarlo en una entrada. Si alguien lo sabe le agradecería que me dijese como he de hacerlo.

El formulario es bastante sencillote, no me he calentado la cabeza con cosas bonitas porque pensaba meterlo en el blog. Simplemente hay que rellenar las dos casillas de la media de goles de los dos equipos y pulsar sobre calcular.

El formulario te devolverá las probabilidades de cada uno de los resultados y sus cuotas teóricas asociadas.

Lo he conseguido colocar dentro de las mil historias que tiene Google para almacenar páginas y podeis acceder a él a través de este enlace:

EDITO 19/04/2020: Pues edit grid lo cerraron hace años, así que os dejo el fichero en el drive de GOOGLE. Podeis acceder a él a través del siguiente enlace:

https://drive.google.com/file/d/1YsK_AefR39nG2UbA-wJKD1beGKCFssmI/view?usp=sharing


Solo es necesario rellenar las cuatro celdas con los partidos jugados por cada equipo y los goles anotados. El resto se calcula automáticamente.

Y la idea sería apostar a aquellos resultados o eventos en los que la cuota que nos indica el libro de excel sea MENOR que la cuota que nos ofrece la casa de apuestas.

Todos los ficheros que comparto en Drive están protegidos,  para poder utilizarlos los teneis que descargar, para ello debeis ir a Archivo > Descargar > Microsoft Excel




Espero que os sirva

Un poco de historia

Está perfectamente demostrado que el ser humano desde sus más remotos orígenes se ha visto atraído y fascinado por los juegos de azar. Los huesos de astrágalo de oveja y ciervo se utilizaban en las primeras civilizaciones como rudimentarios dados, y se han encontrado en yacimientos con más de 40.000 años de antigüedad. En las tumbas egipcias aparecen pinturas que datan del año 3.500 antes de Cristo en las que también se muestran escenas relacionadas con los juegos de azar, incluso Herodoto hace mención a la popularidad y difusión que tienen este tipo de juego en la antigua Grecia.

En estas civilizaciones antiguas era común recurrir a las voluntades divinas de sus dioses para la explicación del azar. Tanto en Grecia, como en Roma e incluso en civilizaciones como la tibetana o hindú, se han utilizado los dados como una forma de interpretar el futuro y de revelar los designios de sus deidades.

Por aquel entonces, todo lo relacionado con el azar estaba rodeado de un halo de misterio y divinidad, hasta que a finales de la edad media comienzan a aparecer personajes ilustres como Tartaglia e incluso el propio Galileo que trataban de dar una respuesta más racional al sentido del azar. Empieza a forjarse con ellos lo que actualmente conocemos como Estadística y Probabilidad.

Una de las primeras reseñas escritas que hay se encuentra en el poema De Vetula de Richard de Fournival (1200-1250) donde se calcula de manera correcta el número de combinaciones posibles para la suma de puntos obtenida al lanzar tres dados.

Pero dejando a un lado la prehistoria del cálculo de probabilidades, parece que fue Girolamo Cardano (1501-1576). quien en 1526 en su 'Liber de Ludo Aleae' introdujo ideas probabilísticas en el análisis matemático de los juegos de azar. Cardano era un personaje realmente peculiar, médico, matemático y astrólogo, intentó aplicar sus conocimientos astrológicos para vaticinar hechos futuros, la verdad es que sin demasiado éxito. Así predijo que Eduardo VI de Inglaterra tendría una larga vida. El rey murió a los 16 años, al año siguiente del vaticinio. Incluso llegó a predecir su propia muerte, en este caso con acierto porque tres días antes de que se cumpliese el plazo, dejó de comer y murió. Pero fue su faceta de jugador la que le hizo centrarse en el cálculo de probabilidades, eso sí, después de que hubiese apostado y perdido todas las joyas de su esposa en una partida de cartas.

Aunque el libro de Cardano es uno de los primeros publicados sobre esta materia, se acepta generalmente como comienzo de la historia de la probabilidad el año 1654, año en el que comienza la correspondencia entre Pascal y Fermât centrada en resolver los problemas propuestos por el caballero de Méré, un jugador más o menos profesional de la época y un apasionado de todo lo relacionado con el juego de los dados y las cartas.

Este caballero creía que había encontrado una "falsedad" en los números al analizar el juego de los dados. Había observado que el comportamiento de los dados era diferente cuando se utilizaba un dado que cuando se empleaban dos dados. La "falsedad" partía de una comparación errónea entre las probabilidades de sacar un seis con un solo dado a la de sacar un seis con dos dados. Para el caballero debía existir una relación proporcional entre el número de jugadas necesarias para conseguir el efecto deseado en uno y otro caso. El problema está en que el citado caballero no tuvo en cuenta que en el segundo caso estaba analizando una probabilidad compuesta en la que las probabilidades se deben calcular multiplicativamente.

La idea de Pascal y Fermât de dar una explicación científica a este y otros problemas planteados por el caballero de Méré es el origen de la Estadística moderna. Como podemos ver la estadística y probabilidad han estado ligadas desde los orígenes a los juegos de azar y es interesante ver como la inquietud de brillantes pensadores y su intento de dar explicaciones racionales a diferentes problemas planteados por un jugador profesional ha derivado en una ciencia mundialmente reconocida.

Volvemos con la MLB

Se nota que ya ha comenzado la liga de béisbol porque cada vez son más las visitas que llegan al blog buscando datos y estadísticas de la MLB. Como ya sabrán los más antiguos del lugar, llevo ya unos años con los retos de la MLB y el año pasado, tras unos comienzos no demasiado esperanzadores, tuvimos un final de temporada expectacular, con unos números y porcentajes de acierto realmente altos.

Por ahora estoy actualizando datos en el sistema, y esperando a que las estadísticas de los pitchers se estabilicen, así que para ir abriendo boca y mientras nuestro sistema empieza a funcionar, voy a colocar predicciones de resultados y ratings de otras conocidas y prestigiosas webs, como: VITIBET, MASSEY RATINGS Y THE PREDICTION TRACKER.

Cada una de ellas coloca sus predicciones a 'su manera' así que lo que vamos a hacer es juntarlas todas en una misma tabla para que sea más sencilla su comparación.

Espero poder tener tiempo suficiente para ir colocándolas a diario, pero no me enrollo más y comenzamos:

PREDICCIONES MLB 13 MAYO 2010:


Pulsar sobre la tabla para verla a mayor tamaño.

En la parte de la izquierda de la tabla (zona con lineas color rojo) tenemos los datos de los equipos, EQ2 es el equipo que juega fuera y EQ1 el que lo hace en casa. En la zona azul tenemos las predicciones (EQ2 = anotación prevista para el equipo de fuera, EQ1 = anotación prevista para el equipo de casa) y los ratings (R), cuanto más positivo o negativo es el rating, más confianza en la victoria del equipo de casa/fuera.

La cristianodependencia del Real Madrid...

... o saben los periódicos deportivos utilizar las estadísticas?. Hace un par de días el diario MARCA sacó en portada una noticia 'reveladora': Con CR9 el Real Madrid es el doble de bueno. Y subtitulaba: Estadísticamente hay cristianodependencia. La conclusión es demoledora, el Madrid marca de media 2.9 goles por partido con CR9 en el campo, mientras que cuando el portugués no ha jugado la media ha bajado a casi la mitad 1.5 goles por partido. Defensivamente ocurre algo similar, con Cristiano Ronaldo en el campo recibe una media de 0.7 goles por partido, frente a los 1.4 que reciben cuando él no juega.

Las estadísticas de MARCA son muy llamativas, pero con estos datos ¿podemos afirmar lo que dice MARCA con esa contundencia?, ¿son estas diferencias lo suficientemente grandes como para decir que no son debidas al azar?. ¿Habrían utilizado alguna herramienta estadística para confirmar esa afirmación?.

Como no eran demasiados partidos, 11 con CR9 y 10 sin él (descontando el jugado ayer en Valencia). Me puse a buscar los resultados, porque con los datos que proporcionaba MARCA, ES IMPOSIBLE saber si las diferencias son estadisticamente significativas. Así que usando las mismas herramientas que cuando analizamos el cambio de entranador, me puse a verificar si lo que MARCA afirmaba era cierto o no. Y estas son las conclusiones:

Analizando los goles a favor:


En el gráfico podemos ver que las dos 'cajas' que identifican las distribuciones de goles del Real Madrid con CR9 en el campo y sin él, tienen una separación evidente. Esta diferencia visual, que se ve claramente en el gráfico, se traduce en una diferencia estadística real y el 2 Sample T-Test así lo indica.

Analizando los datos de los goles en contra, la cosa cambia:


Aquí la distribución de los dos conjuntos de datos no es tan diferente. Las 'cajas' se solapan y esto hace que, aunque existe una diferencia entre medias, estas no sean lo suficientemente grandes como para que sean estadisticamente significativas.

Así que las diferencias que MARCA indica, son reales, pero sus conclusiones no lo son tanto. El Real Madrid marca menos goles sin Cristiano Ronaldo que con él, esto es cierto y estadisticamente esa diferencia es significativa. Pero en cuanto a los goles recibidos, aunque existe una diferencia también, estas diferencias no son lo suficientemente grandes como para decir que sean debida al factor CR9.

Bueno pues ya vemos que cada uno usa las estadísticas como quiere, y saca las conclusiones que le apetecen, unas con más valor que otras. Por eso yo, como norma general, no me suelo creer ninguna estadística que me llegan con conclusiones tan 'llamativas' como las que hemos visto y con tan pocos datos detrás para corroborarlas.

Representaciones gráficas de variables continuas

Seguimos con la estadística que la tenía un poco abandonada y volvemos con la representaciones gráficas de variables cuantitativas continuas. Para la representación gráfica estas variables podemos elegir una gran cantidad de gráficos. Los más útiles son los diagramas de distribución de frecuencias, frecuencias absolutas o relativas y acumulados o no, los diagramas de tallo y hoja (Steam and leaft plot en inglés) y los diagramas de caja y arbotante (box and whiskers plot). Como estos últimos tienen bastante que ver con el cálculo de valores medios y dispersión de los datos los dejaremos para cuando tratemos estos apartados en un futuro.

En esta primera entrada vamos a tratar exclusivamente de las distribuciones de frecuencia y como podemos realizarlas en Excel. Para ello vamos a utilizar el número de goles anotados por minuto en la primera parte de los partidos de primera división como ejemplo de aplicación. Los datos no son reales, pero para el que quiera y tenga tiempo en Betexplorer podeis encontrar toda la info, eso sí, hay que ir partido a partido.

Bueno supongamos que hemos hecho eso, hemos ido partido a partido copiando y pegando todos los datos de Betexplorer en Excel y al final tenemos algo así:


En la primera columna tenemos los minutos en los que se han marcado los goles y en la segunda tenemos el jugador que ha marcado.

Lo siguiente que debemos hacer es 'agrupar' los datos, pero antes tenemos que determinar el número de grupos o clases que vamos a hacer. Este es un paso realmente importante ya que si los grupos se hacen muy grandes, tendremos pocos grupos y muchos datos en cada grupo, se perderá información sobre la estructura de datos y si se hacen muy pequeños, muchos grupos y pocos datos por grupo, es difícil distinguir la tendencia de la distribución. Existen varias reglas para establecer el número de intervalos/grupos, la más extendida es la de hacer el número de grupos igual a la raiz cuadrada de la cantidad de datos disponibles. Otra regla que podemos también podemos utilizar es la regla de Sturges

Para nuestro ejemplo vamos a usar esta última, porque nos da una cantidad de grupos un poco menor que si utilizamos la de la raiz cuadrada. Para 350 datos que tenemos el número de grupos será N = 1 + 3.3 x log(350) = 9.39, aprox 9 grupos. Estos grupos es conveniente que sean de igual tamaño y mutuamente excluyentes, es decir, si tenemos registrados goles desde el minuto 0 al 45 deberemos tomar grupos de 45 / 9 = 5 Minutos. Y deberían ser 0-4, 5-9 ... Así, ningún intervalo es mayor que otro y no existen grupos que incluyan dos minutos iguales.

Ahora debemos calcular nuestra tabla de frecuencias en Excel. Y esto, como la mayoría de cosas en excel, se puede hacer de varias formas:

1. Usando la función frecuencia
2. Usando la función histograma que se encuentra dentro del complemento 'análisis de datos'
3. Usando tablas dinámicas
4. Usando subtotales
5. Usando la función contar.si

Yo voy a usar esta última, porque es la menos utilizada habitualmente en estos casos y además nos servirá para explicar una función de excel realmente potente, pero ya digo que cualquiera de las otras nos podría valer.

El resultado final es el siguiente.


En la primera columna tenemos los mintos empezando en el 0 y acabando en el 50. OJO esto es importante para el cálculo, no debemos acabar en el minuto 45 aunque en nuestros datos este sea el valor máximo. Veremos el por qué al analizar la fórmula de la columna Frecuencia Acumulada. Para el cálculo de la frecuencia acumulada usamos la función contar.si, que tiene dos parámetros. El primero es el rango de datos, en nuestro caso los datos están en el rango A1:A350. El segundo parámetro es el criterio para contar. Para la primera fila debemos contar todos las veces que aparecen números entre 0 y 4, es decir, número de minuto menor que 5. Esto lo podría haber hecho así directamente =contar.si(A1:A350;"<5"). Si utilizamos esta función obtendremos el mismo resultado, pero, en primer lugar, es más lento de programar, ya que debo ir cambiando el criterio para cada fila de mi tabla y en segundo lugar es mucho menos flexible. De la manera que lo hemos hecho cambiando el valor de las celdas de la columna E nos va a cambiar el criterio y nos acutalizará los datos automáticamente. Además la tabla la rellenamos mucho más rápidamente copiando la fórmula a toda la columna. El valor del minuto 50 lo necesitamos ya que el calculo del último intervalo excluye (el menor es estricto, no es menor o igual) al minuto 45 y muchos de los goles que tenemos contabilizados se han marcado en ese minuto, que incluye también los goles marcados en tiempo añadido.

La última columna es la frecuencia sin acumular y su cálculo es sencillo, como se muestra en la imagen. Con esto tenemos acabada nuestra tabla de frecuencias y podemos representar gráficamente los datos. El resultado final es el siguiente


Para el cálculo de las frecuencias relativas debemos dividir cada uno de los valores de nuestra tabla por el total de datos, en nuestro caso 350. Y las graficas que se obtienen son exactamente iguales lo único que nos cambiaría es la escala del eje Y, que pasaría a ser de 0 a 100%.

Bueno, lo dejamos aquí por hoy y si teneis alguna duda o quereís alguna aclaración ya sabeis como contactar conmigo. Un saludo.

¿Para qué sirve la Estadistica?

A pesar de ser esta una cuestión planteada ya en el pasado y sobre la que ya escribimos un post, voy a dedicar alguna que otra entrada más para intentar responder a esta pregunta, cuya búsqueda en google es una de las fuentes de visitas más importantes de este blog. Si haceis la prueba y vais a google y tecleais la pregunta, en primer lugar vais a obtener una página de este blog, y en segundo (la he adelantado en los últimos meses), una página alojada en galeón.

Allí podreis encontrar una buena cantidad de ejemplos de las diferentes aplicaciones de la estadística. Estas probablemente sean las que cualquier buen profesor de universidad os indicaría si le haceis esta pregunta. Pero la estadística, aunque parezca increible, tiene también su parte lúdica.

A través de ella se puede llegar a contestar a preguntas como como:

  • ¿Qué resulta más peligroso: una pistola o una piscina?
  • ¿Qué tienen en común un maestro de escuela y un luchador de sumo?
  • ¿Por qué continúan los traficantes de drogas viviendo con sus madres?
  • ¿En qué se parece el Ku Klux Klan a los agentes inmobiliarios?

No es broma, son las preguntas que se han hecho Steven D. Levitt y Stephen J. Dubner, y a las que han dado respuesta en su libro Freakonomics. Recomendable 100% para todo el mundo, no solo para economistas, o matemáticos, porque no tiene prácticamente ninguna demostración científica y es realmente entretenido de leer. En el libro se muestan una serie de ejemplos prácticos en los se ha utilizado la estadística para responder a preguntas de lo más singulares. Es una especie de pensamiento lateral (thinking outside the box, en ingés) con base matemática. Se trata de estirar y estrujar datos hasta sus límites más insospechados para obtener resultados sorprendentes. Como dicen ellos LAS COSAS A VECES NO SON LO QUE PARECEN.

Algo similar hemos intentado en el blog, en una escala un poco menor, cuando planteabamos la pregunta de si el Real Madrid ha cambiado su estilo de juego. Al final pudimos demostrar con el análisis de unos pocos partidos que los entrenadores que había tenido el Real Madrid era un factor significativo en cuanto a la cantidad de goles que marcaba y recibía el equipo.

La estadistica sirve para esto y para otras muchas cosas, bastantes más de lo que la gente piensa. En futuros post iremos poniendo ejemplos del uso de la estadistica, sus aplicaciones y los resultados que puede proporcionar, en algunos casos realmente sorprendentes.

¿Ha cambiado el Madrid su estilo de juego?

Desde el día 9 de Diciembre pasado, Juande Ramos se hizo con las riendas del Real Madrid sustituyendo a Bernd Schuster al frente del equipo. Es claro que cada entrenador tiene unas características particulares y le gusta un tipo de juego determinado. Cuando dirigen a un equipo, cambian jugadores, el esquema de juego, la disposición del equipo en el campo, o el tipo de juego. Todo con el fin de imprimir su sello particular en el equipo.

Esto podría ser una buena base para el comienzo de una tertulia después de una buena comida con los amigos, pero, ¿se podrá demostrar estadísticamente?. ¿Será posible demostrar que el Madrid de Juande tiene un estilo de juego diferente al de Schuster utilizando la estadística?. Pues a ello vamos en esta entrada.

Para hacerlo vamos a utilizar dos variables, los goles que ha marcado el Real Madrid y los que ha recibido en los partidos dirigidos por uno y otro técnico.

GOLES A FAVOR:


En el gráfico podemos ver los goles que ha marcado el Real Madrid en los dos períodos. A la izquierda tenemos los goles marcados con Juande como entrenador y a la izquierda los marcados con Schuster. Se puede apreciar que las líneas medias (lineas en verde) son bastante similares, con Schuster habían marcado una media de 2.36 goles por partido y con Juande ese valor baja hasta los 1.57. Hay una diferencia de casi 0.8 goles por partido a favor de Schuster, pero esta diferencia no es lo suficientemente grande como para que sea significativa en un test 2-Sample T test. Dejaremos la explicación de este test para futuras entradas.

GOLES EN CONTRA:


Si analizamos los goles en contra las diferencias se agrandan. Con Schuster el Madrid recibía una media de 1.71 goles por partido, mientras que con Juande el equipo defiende bastante mejor y encaja una media de 0.43. Bastante más de 1 gol menos de media por partido. Esta diferencia, utilizando el mismo test, SI ES SIGNIFICATIVA con un nivel de significación del 95%. Lo que quiere decir que es bastante improbable que esta diferencia entre las medias sea debida al azar, una racha de buena suerte, la disposición de partidos en el calendario, etc.

Con esto se puede concluir que Juande ha cambiado el estilo de juego que tenía el Madrid de Schuster y ahora son un equipo que defiende mejor y al que es más difícil hacerle un gol.

Así que la siguiente vez que alguien os plantee la típica pregunta de ¿para qué sirve la estadistica? podeís decir sin ningún temor a equivocaros, que sirve para comprobar que el Madrid de Juande defiende mejor que el de Schuster. Y quedareis como unos campeones.

Análisis Líneas Spread y Over/Under NBA (y 2)

En el anterior post dejamos por analizar los datos de la temporada 06-07. Habíamos visto en el tramo inicial de la temporada 05-06 alguno de los gráficos con tendencias inestables y en los tramos finales también se detectaron discrepancias. Veamos si podemos confirmar estas conclusiones con el análisis de esta temporada.

Puntos Locales (PL)

El gráfico para los puntos locales durante esta temporada es perfecto, con mínimas desviaciones en los tres períodos y sin signo alguno de inestabilidad.

Puntos Visitantes (PV)

Para los puntos visitantes no ocurre lo mismo. El desajuste más importante se ve al final de la temporada con unas diferencias superiores a los 2.5 puntos entre el valor real y el estimado. Los modelos predecían menos puntos que los que en realidad anotaban los equipos visitantes. Este es el error más grande que hemos encontrado hasta ahora.

Spread (Sp)

Para el Spread tenemos un gráfico muy similar al anterior. Las predicciones fueron bastante buenas durante toda la temporada pero debido a ese fallo en las predicciones para los puntos visitantes en el tramo final tenemos un desajuste de más de 1.5 puntos. Las casas colocaban lineas de spread 1.5 puntos de media más bajas de lo que en realidad eran.

Over/Under (OU)

En este último gráfico se aprecia lo mismo que en los dos anteriores. Buenas predicciones durante toda la temporada pero fallo en el tramo final de más de 3 puntos en media.

Con estos análisis de las dos temporadas podemos concluir que las casas tienen modelos de predicción bastante ajustados. Que además son extrapolables de una temporada a otra porque no se han visto discrepancias repetitivas en los tramos iniciales de las dos temporadas para ninguna de las variables analizadas, pero lo que si hemos notado que en los tramos finales de las dos temporadas algo sucede. Las discrepancias entre los valores previstos por los modelos y los valores reales se hacen mayores y probablemente ahí tengamos, lo que los expertos en márketing llamarían, un nicho de mercado. Esperaremos a final de esta temprada para corroborar los resultados.