Archivos compartidos en Google Drive

Cuando empecé a compartir ficheros a través del blog, creía en que la gente los utilizaría siguiendo las instrucciones que daba para su uso, pero evidentemente eso era demasiado pedir y cada dos por tres los ficheros aparecian totalmente modificados, con formulas cambiadas y en algunos casos, borradas. Así que decidí protegerlos todos ellos.

Para poder utilizarlos los teneis que descargar. Para ello deberéis ir a Archivo > Descargar > Microsoft Excel


El P-Value en las apuestas

Bueno, como comentaba en la anterior entrada, vamos con esta segunda parte en la que seguiremos hablando de los test de hipótesis y el P-Value, pero ahora centrado en el tema de las apuestas, que es el motivo por el que me planteé escribir estos dos post.

Ya vimos en la entrada inicial, que el P-Value se obtenía como resultado de un test de hipótesis con el que valorábamos las diferencias encontradas entre DOS variables. El P-Value nos da una indicación sobre la probabilidad de que esas diferencias que hemos encontrado al hacer el test sean reales o sean fruto del azar. Si las diferencias encontradas son muy grandes, el P-Value será muy pequeño y, por tanto, nos está indicando que la probabilidad de que esas diferencias sean fruto del azar es muy baja.

Hay una gran variedad de test de hipótesis y cada uno de ellos se debe usar en función de las variables o los datos que tengamos que comparar. Podemos usarlos para comparar si el cambio de entrenador en el Real Madrid ha influido en la cantidad de goles que anota y que recibe el equipo, como hicimos en este post, o si el rendimiento de un bateador de la MLB podría estar afectado por el color de sus ojos, o si el Real Madrid, en su época, tenía una cristiano-dependencia. En todos ellos los test de hipótesis se usaron para comparar dos situaciones diferentes y concluir si las diferencias entre ellas eran estadisticamente significativas o no. En algunos casos vimos que SI, que había unas diferencias importantes y los P-Value que obteníamos eran muy bajos, con lo que SI podíamos decir que, con un grado de confianza del 95%, esas dos situaciones eran diferentes, pero en otros casos no encontramos diferencias lo suficientemente importantes.

Lo mismo nos pasaba en la entrada anterior, donde hice el supertest UsainBoltiano y me comparaba con velocista jamaicano. El test prácticamente no encontró ninguna diferencia entre Usain y yo. Cuando pasa esto, NO PODEMOS DECIR que esas dos variables que comparamos sean IGUALES, es decir, no podíamos decir que yo soy Usain Bolt, y debemos decir que no hemos encontrado diferencias suficientes para poder asegurar que son distintas. En estas circunstancias, nuestro siguiente paso seria valorar la 'potencia de nuestro test'. Debemos confirmar, si nuestro test es lo suficientemente potente como para encontrar las diferencias que estamos buscando.

Este es el primer problema de los test de hipotesis, que SIEMPRE comparan algo para buscar diferencias, y si no se encuentran esas diferencias, tenemos que confirmar si no las hemos encontrado porque en realidad no las hay o no las hemos encontrado porque nuestro test era una castaña (como asi era en el test de Usain Bolt).

El segundo problema de los test de hipótesis es SABER QUÉ COMPARAMOS. Y aquí es donde entra el tema de las apuestas.

Hace unos meses me topé con un post en Twitter, que me dejó un poco mosca, en el que un tipster hablaba de sus resultados y del P-Value.  Y el remate final fue cuando vi este mensaje de la gente de Pyckio. En ese momento, me quede como un conejo cuando le dan las largas. Hacian un reto contra uno de sus mejores tipsters en el que el ganador se iba a valorar en función del P-Value. 

Me puse a investigar y descubrí que hay un fichero Excel creado por Miguel Figueres que introduciendo 4 datos te devuelve un P-Value. Este P-Value traducido al lenguaje apuestil representa la probabilidad de que los resultados de tu estrategia de picks se deba al azar. Fascinante!!!!.

Pues manos a la obra, voy a meter mis datos a ver que pasa, 975 apuestas, Yield de 0.5, Promedio ponderado de apuestas 3,5 y stake medio 1:


Le doy al enter.... y tras unos segundos de tensa espera, aquí tengo mi resultado:


P-VAlue de 0,000%, eso no lo supera ni el super tipster de Pyckio, soy un TOTAL PRO!!!. Con estos datos estoy seguro que la gran mayoría de vosotros seguiríais mis picks a ciegas. Pues craso error.  Esos picks han sido, 974 apuestas a cuota 2 con stake 1 en la que solo he acertado UNA!!! y, como ya estaba hasta las narices de perder, tras 974 apuestas hice la apuesta 975, que fue una megacombinada a  cuota 1500 y me tocó la lotería, como al finlandés con el podio de la F1 en Monza hace unos dias. Mas azar que esto no puede haber en una estrategia de apuestas, y sin embargo el resultado de los cálculos de fichero me dice que NO, que mis resultados no pueden ser por suerte. ¿Como se explica esto?.

Pues muy fácil, el test que hace el fichero es un test en el que se comparan los resultados de mis apuestas con una función que podemos llamar apuestas medias ponderadas, en mi caso, los resultados de mis apuestas no se parecen ni por lo más remoto a esa función, con lo que el P-Value es enano. ¿Quiere decir eso que mis resultados no han sido fruto de la casualidad?, PUES NO, NO y MIL QUINIENTAS VECES NO. Lo que quiere decir es que los resultados de mis apuestas no se parecen en nada a la función con la que lo comparo y punto.

Así que sintiéndolo mucho, por ahora no he encontrado a nadie que tenga la varita mágica del P-Value en las apuestas, sencilla y llanamente porque NO SE PUEDE MODELIZAR LOS RESULTADOS DE LA FUNCION AZAR que serían los que tendríamos que comparar con nuestras apuestas.

Podría haber un caso en el que se podría hacer algo pero eso lo dejo para otro post, si a alguno de vosotros os interesa.



Los Test de Hipotesis, el P-Value y Usain Bolt

Usaint
Hace algunos años, en este post, explicaba cómo se podía hacer un test de normalidad en Excel y en él hacía mención a lo que en estadística inferencial se llama el p-value. El p-value, como su propio nombre indica, es un 'valor' que se obtiene como resultado de un test de hipótesis, en el que se suele plantear una disyuntiva entre dos alternativas. 
Voy a intentar ser lo más elemental posible en este post para que se pueda entender de manera fácil. 
Imaginemos que lo que queremos analizar es si yo soy Usain Bolt o no. Para ello haremos un test en el que planteamos dos hipótesis:
  • La hipótesis nula (H0) sería que yo soy Usain Bolt
  • La hipótesis alternativa (H1) sería que no lo soy
 Ahora nuestro test de hipótesis lo que hace es: 
  • Vale, voy a darte el beneficio de la duda y vamos a partir de la base que SI lo eres. Ahora voy a usar mis métodos para intentar encontrar pruebas (diferencias) y dependiendo de lo grandes que sean esas diferencias te diré si deberías rechazar H0 o no.  ¡¡OJO!!, no digo aceptar, digo rechazar o no, la explicación a esto la veréis más abajo.
Bien, pues vamos con nuestro test que pretende encontrar esas diferencias. El test consiste en las siguientes 10 preguntas:
  1. ¿Eres hombre?
  2. ¿Eres negro?
  3. ¿Tienes dos piernas?
  4. ¿Has asistido alguna vez a unos juegos olímpicos?
  5. ¿Tienes hermanos?
  6. ¿De pequeño jugabas al futbol?
  7. ¿Te gustaría jugar en el Manchester United?
  8. ¿Te gusta la música?
  9. ¿Juegas al dominó?
  10. ¿Has corrido alguna vez la prueba de 1500 m?
 Las respuestas a esas preguntas si se las hiciésemos a Usain serían todo Sies menos la última que es un No.
Si me las hago a mí, la respuestas son todo sies menos la segunda y la última.
Es decir que el 90% de mis respuestas coinciden con las de Usain. Este test, no ha conseguido encontrar practicamente ninguna diferencia entre Usain y yo. Con estos resultados, el p-value que obtendríamos estaría bastante por encima del 0.05 que suele ser el valor de corte utilizado para rechazar o no la hipótesis nula.
A la vista de estos datos, MUCHA GENTE diría, como el p-value es mayor que 0.05 (lo que se denomina nivel de significación) aceptamos H0 como válida, lo que equivale a asegurar que SOY USAIN BOLT.
Lamento decepcionaros, pero evidentemente no lo soy.
Uy, pero entonces, ¿Que ha pasado?. Pues muy fácil, mi test es tan sumamente malo que no encontraría diferencias significativas entre cualquier hombre de este país y Usain Bolt. Así de sencillo.
Cuando obtenemos este tipo de resultados en un test de hipótesis, EN LUGAR DE ACEPTAR H0, lo que se DEBE DECIR es que no hemos encontrado diferencias suficientes para RECHAZAR H0 y lo que nos debemos plantear en este caso es si nuestro test es suficientemente potente como para encontrar esas diferencias. Como todos vosotros coincidiréis y viendo esta patata de test, la respuesta a la pregunta es un rotundo NO.
Cualquiera de vosotros puede encontrar otra batería de 10 preguntas, o de menos incluso, que permita identificar, con una certeza casi absoluta, si la persona que responde al test es o no es Usain Bolt. He de reconocer que me ha costado encontrar 10 preguntas para hacer el chapuza test este, buscando información sobre Usain hay miles de cosas que preguntar que nos distinguirían de inmediato entre uno y otro.
Como no quiero hacerlo muy largo, por hoy, lo dejamos aquí y en el siguiente post veremos la relación entre el p-value y las apuestas, que es algo que en Twitter está muy de moda.

Aplicacion de Poisson en el Futbol y otros deportes

Sois muchos los que me estáis pidiendo que os de acceso a ficheros de Excel que tengo colgados en el drive, y a otros que, por motivos varios, han desaparecido de la web. Estoy ya bastante desconectado de las apuestas, porque, os digan lo que os digan, los únicos que ganan en esto de las apuestas son las casas. Lo digo con conocimiento de causa y después de que me hayan cerrado decenas de cuentas por ganar dinero, la última sin ir mas lejos me la cerraron después de hacer menos de 20 apuestas y con un beneficio de unos 50 Euros.

Cuando la casa detecta que puedes ser un riesgo para ellos, te cierran la cuenta (como me hicieron en William Hill) o te dejan apostar cantidades ridículas de dinero (como me hicieron los de Bet365). Después de esta advertencia cada uno que haga lo que crea conveniente, pero ya os digo que todo aquel que os diga que gana dinero de manera constante con las apuestas os estará mintiendo el 95% de las veces.

Volviendo al tema inicial, tengo un montón de ficheros Excel con datos, estadísticas y estrategias, que si tengo tiempo iré compartiendo por el blog. Uno de los que más me pedís es el de calculo de probabilidades de Poisson, y es el primero que os compartiré. Como comento en la entrada inicial sobre este asunto:

Solo es necesario rellenar las cuatro celdas con los partidos jugados por cada equipo y los goles anotados. El resto se calcula automáticamente.

Y la idea sería apostar a aquellos resultados o eventos en los que la cuota que nos indica el libro de excel sea MENOR que la cuota que nos ofrece la casa de apuestas.

Espero que os sirva

Enlace al fichero:
https://drive.google.com/file/d/1YsK_AefR39nG2UbA-wJKD1beGKCFssmI/view?usp=sharing

Estudiar el pasado puede definir el futuro - Parte 2

7 días después estamos de vuelta para completar el post que inicié el fin de semana pasado. Como recordáis tomamos los datos de la web European Centre for Disease Prevention and Control para hacer las predicciones y los gráficos que os muestro en estas dos entradas.

La pregunta que lanzábamos hace una semana era, ¿Se puede predecir el comportamiento de la evolución de casos en los distintos países?. Vosotros mismos la vais a poder responder si continuáis leyendo. La zona sombreada en amarillo son los datos nuevos de esta semana.

  • Italia

A Italia la dejamos en su día 27 y su gráfica merece un optimismo moderado, se ha ido despegando de la curva ajustada y da señales de una bajada en la cantidad de contagios, lo que es una buena señal.

  • ALEMANIA

A Alemania la dejamos en su día 22 y la evolución es positiva, como en Italia, su gráfica en azul (casos reales) se va alejando de la curva de ajuste. Buena señal también.

  • CHINA

China llevaba mucha ventaja al resto de países en la gráfica, y como podéis ver sus casos reales se han estabilizado por completo. Todas sus acciones han dado resultado y se puede decir que la pandemia en este país está bajo control.

Y ahora vamos con nuestros campeones

  • ESTADOS UNIDOS
Su maravilloso presidente, pasó olimpicamente de aprender de lo que estaba sucediendo en otros países y no tomó ninguna medida. Hace una semana dijimos que en 7 días superarían los 100.000 infectados, y en siete días se plantaron en 104.000, hoy van por los 124.000 y subiendo religiosamente pegados a su curva de predicción, aunque, hay que decirlo, por debajo de ella. Dentro de lo malo lo menos malo.

  • ESPAÑA

 Y por último ¿que ha hecho España?, pues salirse, como una campeona!!
Como nuestros compañeros los yankis seguimos nuestra peregrinación por la curva de predicción, pero, no conformándonos con eso, la mejoramos!!!. Y nuestros gobernantes diciendo que ya se ven indicios de mejora en alguna comunidad. Es increíble. El hormigón armado que se gastan nuestros y políticos en su rostro, para sí lo querrían muchas de las constructoras que estos días van a tener que dejar a toda su plantilla en casa.

Si vamos a las previsiones hechas hace una semana este es el resultado:

Dia Pred Real Error Porc (%)
Domingo 24160 24892 732,0 3,0%
Lunes 28630 28538 -92,0 -0,3%
Martes 33680 33055 -625,0 -1,9%
Miércoles 39370 39639 269,0 0,7%
Jueves 45730 47576 1846,0 4,0%
Viernes 52824 56154 3330,0 6,3%
Sábado 60700 64025 3325,0 5,5%

Hasta el pasado miércoles íbamos copiando la curva casi al pie de la letra, pero los tres últimos días hemos despegado. Yo lo dejo aquí porque se me puede ir la tecla y soltar algún improperio.

Señores.... disfruten lo votado.

Estudiar el pasado puede definir el futuro - Confucio

Hace tiempo que tengo el blog abandonado por razones varias, pero el momento actual creo que bien merece una entrada nueva. Estamos viviendo una situación excepcional, que nos marcará y recordaremos durante toda nuestra vida y me duele en el alma que ver como se colapsan hospitales, como se incrementa día tras día el número de victimas ante la pasividad o lentitud en la toma de decisiones.

En esta entrada no voy a hablar de apuestas deportivas, obviamente no estamos en el tiempo ni el lugar para ello, lo que voy a plantear es la necesidad de estudiar y aprender, de analizar datos, de hacerse preguntas y de buscar soluciones.

Todos los datos que he utilizado los podéis encontrar en la web del European Centre for Disease Prevention and Control, desde donde se puede descargar un fichero Excel con toda la información sobre casos detectados y fallecidos por la pandemia del COVID-19.

No me enrollo mas y comenzamos. Como muchos de vosotros ya sabréis este virus es especialmente peligroso por la tasa de contagio que tiene. La OMS estima que esta tasa de contagio (R0) oscila entre 2 y 3, lo que significa que cada persona contagiada con el virus puede a su vez contagiar a 2 ó 3 personas más. Para que nos hagamos una idea, la gripe, por ejemplo, tiene una tasa de 1.5.

Esta tasa de contagio no es fácil de calcular pero, vamos a intentar estimarla con los datos facilitados por el ECDC para varios países, en concreto, China, Italia, Alemania, España y Estados Unidos.

El día 1 en los gráficos corresponde al primer día en el que los casos acumulados superan los 20 contagiados.

Empezamos con nuestros vecinos Europeos.
  •  ITALIA:

La gráfica azul representa los datos reales mientras que la naranja son los datos ajustados a una función exponencial cuya expresión es:


Donde x es el numero de días transcurridos, c es una constante para ajustar el punto inicial de la curva y b es lo que podríamos llamar el ratio de contagios. El ajuste de la curva como podéis ver es prácticamente perfecto (lo he hecho en Excel usando el Solver, por no alargar el post no pongo aquí todo el desarrollo).

Para Italia estas tres variables toman los siguientes valores:
c=1495.73 a=0.19 y b=3.76
  • ALEMANIA

El ajuste en este caso no es tan bueno, pero vemos que también sigue una curva exponencial cuyos parámetros son: c=0 a=0.0031 y b=5.02
Lo más llamativo de este caso es que el valor del ratio de trasnsmision ha subido a 5.02 que hará que el ascenso de los casos será mucho más acentuado.

Y en ESPAÑA, ¿COMO ESTAMOS?

  • ESPAÑA
Pues tenemos un ajuste prácticamente perfecto, y nuestros parámetros son:
c=28.88 a=0.18 y b=3.82
Estos datos son practicamente CALCADOS a los de Italia, aunque nosotros estamos en el dia 21, mientras que ellos están en el 28. ¿que quiere decir esto? pues que SI NO HACEMOS NADA MAS, las previsiones para los próximos dias son (hoy estamos a Domingo 22 de Marzo de 2020): Domingo 24160, Lunes 28630, Martes 33680, Miércoles 39370, Jueves 45730, Viernes 52824, Sábado 60700

Espero equivocarme, pero, como dicen en el anuncio... yo ahí lo dejo.

Nos quedan ver dos paises importantes.

  • ESTADOS UNIDOS

Otro ajuste impecable, pero este MUCHO MAS PELIGROSO, ya que sus parámetros son: c=0 a=0.0003 y b=6.03. 
La falta total de coordinación y medidas contra el virus va a hacer que su crecimiento sea mucho más acentuado que en Europa, y el modelo predice que dentro de 7 días el número de infectados superará los 100.000


  • CHINA
El modelo predice prácticamente sin fallos desde el dia 1 al 22 (mas o menos donde estamos nosotros ahora) con parámetros c=0 a=3.42 y b=3.00 muy parecidos a los de Italia y España. Pero a partir del dia 22 la cosa cambia.

La gráfica empieza a desviarse de la predicción y sobre el dia 30 comienza a aplanarse. SEÑORES DEL GOBIERNO, hagan el favor de averiguar que hizo CHINA en esos días previos y COPIEMOS la estrategia para parar este terrible goteo diario de muertes.

Este POST tendrá otro de continuación dentro de una semana, cualquier comentario es bienvenido. Hasta entonces, cuidaos mucho y espero volveros a ver a todos dentro de 7 días.

Los peligros del YIELD

Hola de nuevo. Volvemos después de una 'pequeña' parada del blog con un tema que siempre me ha gustado que es origen de múltiples debates y alguna que otra discusión. Nuestro querido YIELD.

El YIELD es una de las medibles más utilizadas e incluso para muchos, el sanctasanctórum del mundo de las apuestas. Supongo que la mayoría habrá oído hablar alguna vez sobre ella y sabrá que su cálculo se realiza de la siguiente forma:

Yield = Beneficios / Cantidad total invertida.

Normalmente el resultado de este cociente se expresa en % y representaría al porcentaje de beneficios obtenidos por cada unidad apostada. Es decir que, si vemos que alguien tiene un YIELD del 5% lo que nos está indicando es que por cada 100 uds apostadas ha obtenido un beneficio de 5.

La interpretación, como puede verse, no es demasiado complicada pero su uso como variable para comparar la efectividad entre tipsters tiene alguna que otra pega. Si fuese una variable robusta permitiría establecer un criterio objetivo para la clasificación de TIPSTERS o para evaluar los resultados de nuestras estrategias de apuestas, pero esto, como veremos más adelante, esto no es así. Reduciendo a un solo número tanto cuotas, como cantidades apostadas y número de aciertos, se consigue tener una visión más sencilla de los resultados pero, por el contrario, se produce una degeneración en la información. Vamos a verlo con un ejemplo.

Supongamos que hemos hecho el seguimiento de dos tipsters durante 10 apuestas, y el primero de ellos ha obtenido un Yield de 9.0% mientras que el segundo lo ha mejorado y ha llegado al 11.0%. Los dos son unos valores buenísimos y si nos guiamos exclusivamente por el Yield deberíamos decir que el tipster 2 'es mejor' que el tipster 1. Según este cálculo, su sistema de apuestas genera mejores resultados, en teoría. Pero, ¿es esto realmente cierto?. Comprobemos que ha sucedido:

Analizamos más detalladamente los resultados de cada uno, para ver que factor de los tres (las cuotas, el stake y  el porcentaje de aciertos) influye en esta diferencia .

En primer lugar vemos que ambos han apostado a eventos Over/Under que se pagaban a cuota 1.9 en los dos casos, con lo que parece que las cuotas no han sido la fuente de variación para el Yield.

En cuanto al segundo factor, la gestión del bank (stake o cantidad apostada en cada apuesta), ambos han optado por una gestión de bank idéntica y han arriesgado un 10% de su capital en cada apuesta. Tampoco parece ser que la gestión del bank haya influido en el resultado del yield

Nos queda por último el % de aciertos de cada uno. Este, por eliminación, debe ser el factor determinante,  pero, vemos con asombro que ambos han acertado 6 de las 10 apuestas que han realizado, con lo que el porcentaje de aciertos tampoco debería ser un factor.

En resumen, dos tipsters, apostando a las mismas cuotas, con la misma gestión de bank y el mismo porcentaje de aciertos TIENEN DISTINTO YIELD!!. Y para aumentar más la intriga si cabe, puedo decir que HAN CONSEGUIDO EL MISMO BENEFICIO AL FINAL DE LAS 10 APUESTAS.

¿Como es posible?. Aquí os dejo los números:


La única diferencia entre un tipster y el otro ha sido EL ORDEN EN EL QUE SE HAN IDO ALTERNADO FALLOS Y ACIERTOS.

Pero la cosa no queda ahí, si cambiamos la gestion del bank y optamos por un stake plano de 0.71 uds. obtendremos para cualquiera de ellos el mismo beneficio final (dejo el cálculo para el ávido lector) pero ahora el YIELD ha subido al 14% y además en este caso el YIELD es constante e independiente del orden en el que se han ido produciendo los fallos y aciertos.

Todos estos motivos hacen que el YIELD para mi sea una variable secundaria para el análisis de estrategias de apuestas. Si la única información que tengo es el propio valor, no le suelo dar demasiada importancia, me sirve únicamente para saber que la estrategia puede ser viable, pero nada más. Si lo que pretendo es estudiar varias estrategias de apuestas lo primero que hago es calcular el YIELD con una estrategia de STAKE PLANO, así elimino la influencia de la distribución de aciertos. En estas circunstancias el YIELD ya me resulta de mayor utilidad.

Con este artículo no pretendo desterrar al YIELD como medible, sino dar a entender que no es oro todo lo que reluce entrono a él. y que hay que tener Mucho Ojo con el YIELD, con su cálculo y mucho más ojo todavía con su interpretación.

Modelo de prediccion de resultados de un partido de Futbol (Paso2)

En primer lugar quiero agradecer a todos los que han colaborado con las sugerencias el tiempo que me han dedicado enviado los factores que para ellos eran importantes. Ya hemos recogido unos cuantos y podemos empezar a comentarlo.

Empezamos por orden de importancia en cuanto a la cantidad de sugerencias recibidas:

 1. Goles: Ha sido el factor más votado y es el más fácil de conseguir, con lo que tiene todo para ser considerado como uno de los principales en el modelo de predicción. En algunos casos no se especifica claramente, pero tomaremos los goles a favor, y en contra de los dos equipos.

2. Bajas: El segundo factor más votado han sido las bajas. Este ya tiene un poco más de dificultad porque los modelos deben incluir parámetros transversales, es decir, que sean cuantificables en todo el conjunto de datos que tengamos para ajustar el modelo y para predecir. Así que deberemos traducir el factor BAJAS a algo valorable en cada equipo, relacionado con las alineaciones. Se me ocurre algo parecido a los puntos que tiene cada cromo de la liga, o bien puntos o euros que cuesta cada jugador en Comunio, o algo similar. Un sistema de puntuacion similar al de Fanaticleague sería ideal. Se aceptan sugerencias también para esto.



3. Arbitro: No ha sido mayoritaria pero algunos de vosotros ha considerado que esta variable también debe ser incluida en el modelo. En este caso pasa algo similar a lo que hemos comentado con las bajas, hay que cuantificar también. Podría ser el % de partidos ganados empatados y perdidos del equipo de casa cuando pita un determinado colegiado y lo mismo para el de fuera. Aceptamos, por supuesto, otras sugerencias.

4. Clima: Otro factor dificilmente cuantificable, al que incluso podríamos añadir hora del partido (mañana / tarde / noche).  Mi propuesta sería hacer algo similar al caso del arbitro, % de partidos ganados / empatados / perdidos.

Con estos factores acabamos la entrada de hoy, en la siguiente continuaremos con los que quedan, pero antes me gustaría proponer algunos más que curiosamente no han recibido ningún voto:

  • Distancia recorrida por el equipo visitante. Hay estudios que indican que hay una relacion entre victorias visitantes / locales dependiendo de las distancias recorridas por el equipo visitante.
  • Estrategia / Esquema de juego de cada equipo. 
  • Ponderación de partidos o goles en función de la fortaleza del equipo contra el que se ha jugado (algo similar al rating ELO de los jugadores de ajedrez), es decir, no es lo mismo haber jugado 5 partidos contra los últimos equipos de la liga que contra los primeros. 
Un saludo y sigo atento a vuestras sugerencias.

Modelo de prediccion de resultados de un partido de Futbol (Paso1)

Hola a todos,

La idea de este post es comenzar el desarrollo de un modelo de predicción de resultados de un partido de fútbol con la colaboración de todos los visitantes del blog. El primer paso para crear nuestro modelo va a ser una tormenta de ideas (brainstorming) para recoger todos los factores posibles que debería incluir el modelo.

Para ir recogiendo las respuestas he creado el siguiente formulario:



En el campo del formulario poned solo un factor y lo enviais. Si quereis agregar otro solo teneis que volver a rellenar el campo y pulsar enviar otra vez. Dejaré un tiempo prudencial el formulario para ir recogiendo las respuestas y luego haremos un análisis de los resultados. Un saludo a todos y gracias por vuestra colaboración.

El retorno con nuevo reto

Lamentablemente el tiempo del que dispongo para actualizar el blog cada vez es menor y el tiempo que pasa entre un post y otro se hace cada vez mayor. Se que un post semanal es realmente complicado y no puedo plantearmelo como objetivo, pero lo que si puedo permitirme es al menos un post mensual. Se que no es mucho, pero algo es algo, y con esto evitaré la sensación de abandono que tengo ahora cada vez que visito el blog.

Así que .... tenemos nueva meta, al menos un post mensual. Espero cumplirla y para ello vamos a comenzar a lo grande, con un nuevo reto, en fútbol, algo que no me gusta mucho pero por los datos que tengo puede que nos de resultados.

Será un reto de over under sobre la liga española de primera división y lo llevaremos como siempre en el blog de los retos.






El poder de las pequeñas cosas

Son muchas las personas que me han contactado y siguen contactando para pedir ayuda a la hora de calcular las probabilidades de los posibles resultados de un partido. La mayoría de ellos lo hacen después de haber leído la entrada referente a la distribución de Poisson y su aplicación al futbol. Allí explicamos como mediante una simple fórmula se puede realizar una aproximación a la probabilidad real de los resultados de un partido. Esto tiene su parte buena y su parte mala. La buena es que con sólo un par de datos (goles a favor del equipo de casa y del equipo de fuera) se puede calcular una probabilidad, que, debido a lo simple del método, no siempre resultará cierta. Esta es la parte mala.

Si tomamos esta base como único pilar para nuestra estrategia de apuestas, lo tenemos realmente difícil para salir en verde a largo plazo. Estamos intentando crear un modelo de predicción de un evento realmente complejo, como es un partido de fútbol, usando únicamente dos parámetros. En el resultado final del partido intervienen infinidad de variables que nuestro modelo no tiene en cuenta y al que afectarán en mayor o menor medida.

Muchas de estas varibles pueden resultar ridículas a primera vista, y mucha gente no las tendría en cuenta. Existen jugadores de futbol que saltan al terreno de juego pisando siempre con un pie determinado, otros lo hacen justo en la tercera posición, otros tocan el cespéd... también en el tenis se pueden encontrar actuaciones similares, hay algunos tenistas que intentan no pisar las líneas, o sacar siempre el primero, cambian la raqueta al cabo de 8 juegos o botan la pelota 8 veces antes de sacar. Todas estas variables normalmente no se tienen en cuenta en los modelos de predicción pero, por increíble que parezca, pueden llegar a tener influencia en el resultado. Esta influencia puede lleagar a ser demostrada mediante test estadísticos. Aquí hemos usado ya test similares para analizar la influencia de jugadores o entrenadores en la cantidad de partidos ganados o la cantidad de goles marcados.

Este verano en uno de mis devaneos por la red, andaba yo buscando información sobre la MLB y me llevé la sorpresa de que existe un foro en español sobre el tema, en el que además existe un apartado sobre sabermetrics. En este foro se planteó si el rendimiento de un bateador podría estar influenciado por un factor que resulta realmente llamativo: el color de sus ojos.

La historia comenzó cuando Josh Hamilton, bateador de los Texas Rangers, comentó que le resultaba mucho más complicado batear en los partidos jugados durante el día que en los que se jugaban por la noche. Sus números así parecen indicarlo:


De día le han realizado 49 lanzamientos, con los siguientes resultados:
  • Bateados: 6
  • HR: 0
  • RIB's: 4
  • Walks : 8
  • SO: 17
  • OPS: 0.429

Con luz artificial le han realizado 109:
  • Bateados: 41
  • HR: 6
  • RIB's: 28
  • Walks : 7
  • SO: 14
  • OPS: 1.076.

Con estos datos se puede demostrar estadísticamente que para este bateador los efectos de la luz natural tienen efectos negativos en su juego. Todos los test realizados sobre los parámetros anteriores tienen significación estadística, esto quiere decir, que con un 95% de probabilidad podemos rechazar que las diferencias sean debidas al azar.

Usando estas mismas variables se podría ampliar la hipótesis a todos los lanzadores con ojos claros e intentar demostrar que siempre tinen mejores números con luz artificial, que con la luz de día. No sería difícil, si alguien se molesta en recoger los datos lo podemos hacer. Por lo pronto Josh ha decidido jugar los partidos diurnos con unas lentillas de color... rojo!!. ¿Será esto suficiente para ver mejorar su rendimiento?, pronto lo veremos... y nunca mejor dicho.

Pitágoras y la MLB

Este filósofo, pensador y matemático griego da nombre a uno de los teoremas más conocidos de las matemáticas: El Teorema de Pitágoras, aunque, paradójicamente, no se le puede atribuir ni él ni tampoco a su escuela su descubrimiento. En civilizaciones mucho más antiguas como la babilónica, la hindú o la egipcia, ya eran conocidas las llamadas ternas pitagóricas: tríos de números que cumplen con este teorema.

Una de las más famosas, la terna 3-4-5, era denominada por los egipcios 'el triángulo sagrado' y la pirámide de Kefrén, por ejemplo, fue construida basándose en ella. Su lado mide 412 Codos y su altura estimada en la época de su construcción era 275 Codos. La relación entre la semi-base de la pirámide (412 / 2 = 206) y la altura 275 es de 3/4 (206 / 275 = aprox 0.75 = 3/4).

Por increíble que parezca, también tenemos referencias a esta fórmula en el mundo de las apuestas. Un estudioso de la MLB llamado Bill James, descubrió hace unos 30 años, que había una relación entre las carreras concedidas y anotadas por los equipos de la MLB y su porcentaje de victorias. Esta relación la expresó como:


Debido a la similitud de esta fórmula con el teorema de Pitágoras, en el que todos sus valores también aparecen elevados al cuadrado, la denominó el teorema de Pitágoras para el beisbol.

A partir de aquí otros muchos investigadores han intentado aplicar el mismo concepto de fórmula para otros deportes y así se ha llegado a la misma fórmula en la que los doses se sustituyen por los siguientes factores:

NFL: 2.37

NCAA Basketball:10

NBA: 14


La finalidad de esta fórmula es predecir cual sería el porcentaje teórico de partidos ganados en función de los puntos anotados y recibidos. Esto puede ser de gran interés para el apostante. Este valor teórico se puede comparar con el real y en consecuencia se pueden determinar equipos que sus valores reales están 'desajustados' frente a las predicciones. Si la realidad refleja un valor inferior al teórico se supone que ese equipo debe mejorar en un futuro y el % de victorias debe ser superior al que ha obtenido hasta ese momento, por el contrario si el valor real es superior al teórico, tenemos a un equipo 'sobrevalorado' y sus resultados deberían ser peores en un futuro.

En la temporada 2006-07 los Miami Heats tenían una media por partido de 94.6 puntos anotados frente a 95.5 recibidos. Su porcentaje de victorias esperadas era del 47% frente al 54% (44-38) que llevaban durante la temporada. En los play-offs cayeron estrepitosamente 4-0 frente a Chicago.

Algo similar le sucedió a los Dallas Mavericks, que comenzaron los playoffs con un 74% teórico frente a un 82% real. También fueron eliminados en la primera ronda de los playoffs.
San Antonio Spurs se presentaban a los playoffs con un panorama radicalmente diferente: un 71% de victorias reales frente a las 78% esperadas. Los números parecían indicar que los Spurs, no lo iban a hacer mal en los playoffs, y así fue, resultaron los ganadores de ese año y en los play offs consiguieron un registro de 16 partidos ganados frente a 4 perdidos (80%).

Otros ejemplos como estos se pueden encontrar analizando otras ligas y otras temporadas, y la idea sigue siendo la misma, estimar un nuevo parámetro que nos permita añadir un factor más al análisis de nuestros picks. Ahora es responsabilidad de cada uno ajustar su peso en la decisión final. Tanto si es alto como si es bajo, confío que os sea útil de alguna manera.

Apostando a ciegas

Recuerdo que hace un par de meses recibí un mail de un visitante del blog que me comentaba que era nuevo en este mundo de las apuestas y que antes de abrir ninguna cuenta y comenzar a arriesgar su dinero había estado leyendo e informándose sobre todo lo concerniente a las apuestas deportivas. Esta es una postura que me parece de lo más razonable y, aunque sé que no es lo habitual, sería lo deseable para todo aquel que decida iniciarse en este mundo.

También me indicaba que, como su experiencia era limitada, se había planteado empezar copiando picks de tipsters con números positivos y estables a largo plazo. Esto tampoco me parecía una mala opción y así se lo comenté en mi mail de contestación.

Al cabo de unas semanas llegó la hora de hacer balance de sus primeros pasos y pese haber seguido religiosamente los picks de los tipsters, su YIELD no era comparable. Esto le llamó poderosamente la atención y me preguntaba intrigado, como podía ser posible, si había hecho exactamente lo que el tipster indicaba.

La respuesta es bien sencilla. Descartando el hecho de que hubiese cometido alguna imprudencia con los stakes, la clave estaba en las cuotas. Apostar ciegamente a los picks que ofrecen ciertas páginas o tipsters no tiene ningún sentido si no consideramos las cuotas y los stakes. Un pick puede pasar de ser un buen value, a ser una apuesta de alto riesgo, simplemente porque la cuota que hemos encontrado es inferior a la que indica el pick. Este cambio en la cuota puede venir provocado bien porque ha bajado desde que el tipster publicó su selección o bien porque nuestra casa tiene cuotas inferiores a la casa en la que el tipster juega habitualmente. Independientemente de uno u otro motivo el resultado final es siempre el mismo.

La demostración matemática de este hecho no resulta complicada.

Apostando una cantidad fija (K) a una cuota fija (C) el YIELD se puede reducir a calcular:
YIELD = C x % medio de aciertos - 1
Jugando un poco con los números, si nuestro tipster estrella tiene un porcentaje de aciertos del 54% en eventos a cuota 1.95 su YIELD será de:

YIELD = 1.95 x 54% - 1 = 5.3%

Si nosotros seguimos ciegamente sus apuestas, tenemos, como es lógico, el mismo % de acierto, 54%, pero para nuestra desgracia la cuota media de nuestros picks se ha visto reducida hasta un pobre 1.85. Con estos números:

YIELD = 1.85 x 54% - 1 = -0.1%

Así pues, mientras el tipster estrella va incrementando su bank constantemente, nosotros, con los mismos picks, aciertos y stakes, nos vamos moviendo en el filo de la navaja y una mala racha del tipster nos empujará hacia el abismo rojo.

Por todo ello, mi consejo es NO APOSTAR si no encontramos cuotas idénticas o superiores a la de los picks de los tipsters a los que nos gusta seguir. Es decir, NO APOSTAR A CIEGAS a algo por el mero hecho de que un gurú de las apuestas así lo indica.

El retorno de las casas

Ya hablamos en una ocasión sobre el beneficio que tiene el buscar siempre la mejor cuota en nuestras apuestas. Como es absolutamente lógico, cada persona que se inicia en el mundo de las apuestas lo hace con la finalidad de rentabilizar su inversión. Para ello debemos buscar entre toda la oferta aquella que más ganacia nos de para una misma cantidad apostada.

Una manera fácil de hacerlo es calculando el retorno de las casas. El pasado 21 de Marzo para el choque de la premier entre el Manchester Ud. Y el Liverpool Pinnacle ofrecia 1.7 por la victoria del Manchester, 5.62 por la victoria del Liverpool y 3.94 por el empate, mientras que Bwin ofrecía 1.6, 5.5 y 3.6 por los mismos resultados.

En la primera casa si apostásemos la cantidad necesaria a cada opción para obtener el retorno de 1 ud. Deberíamos gastar:
1/1.7 + 1/5.62 + 1/3.94 = 0.588 + 0.178 + 0.254 = 1.02 ud.
Es decir, apostando 0.588 uds @ 1.7 (victoria del Manchester) 0.178 @ 5.62 y 0. 254 @ 3.94 independientemente del resultado que se diese obtendríamos 1 ud. de retorno. En este negocio hemos invertido 1.02 uds y recibimos 1 ud. Esto equivale a 1/1.02 = 98% de retorno de la inversión por parte de la casa. Por cada unidad apostada recibimos 0.98.

Para el segundo caso haciendo los mismos cálculos el retorno de la casa es de tan solo el 92%.

Siguiendo el mismo procedimiento hemos calculado el retorno de otras casas para el mismo partido. El resultado lo podeis ver en la tabla lateral, de la que cabe destacar dos cosas:

  1. No siempre las casas de intercambio de apuestas ofrecen los mejores retornos
  2. Deberíamos pensar en tener cuentas en las casas con mejores retornos, que por norma general son las que mejores cuotas ofrecen para todas las opciones.
Os dejo también una pequeña hoja para que podais hacer vuestros propios cálculos. Espero que os sirva.

EDITO 21-01-11: He añadido una columna más a la hoja de calculo para poder poner la comisión de la casa.

EDITO 03-06-12: Parece ser que hay gente que su unica finalidad es fastidiar las hojas que dejo abiertas para que puedan ser modificadas. Esta por ejemplo la ha borrado por completo. No me cuesta más que un click recuperarla, pero me cuesta entender que haya personas que dediquen su tiempo a cosas como esta. Bueno, pues nada, aqui está otra vez recuperada para que la vuelvas a borrar.

Predicciones NBA Jueves 13 Enero

Ultimo dia de predicciones en este blog, a partir de mañana las iré colocando el blog de los retos.

Las cuotas son siempre de Pinnacle:
  • Victoria de Orlando @ 1.862 frente a Oklahoma
  • Denver + 2 @ 1.952 frente a Miami

Predicciones NBA 12 Enero

Hoy hay un partido claro que es la victoria de Boston, no tengo muy buenos recuerdos de las predicciones a partido de Boston, que fue el equipo que me pifiaba los números en el reto de alto porcentaje de acierto, pero creo que esta temporada es diferente.

Para los Spreads, vamos con Lakers -5.5, Miami -7.5 y Boston -13

Feliz 2011

He de reconocer que desde finales de año he estado de 'huelga de post caidos' así que vamos a intentar romper la racha y aprovecho este día por lo bonito del número 11 - 01 - 11 para colocar el primer post del año y de paso felicitar a todos los visitantes y desearles lo mejor para este año que empieza.

Es gracioso el número del día de hoy porque si lo tomamos como un número binario su equivalente en decimal es el 55, que suele ser el límite de porcentaje de aciertos que tomo en mis estrategias. Parece un buen augurio, :-)

De paso aprovecho el post para agradecer los comentarios del chat a todas mis admiradoras extranjeras, thanks a lot for your comments, I wish all the best to you too. Me pregunto si entenderán algo del blog, porque no recuerdo haber escrito nada en inglés en todo este tiempo.

Así que para comenzar el año con alegria vamos con mis recomendaciones para la NBA de hoy 11 de Enero:

  • Victorias simples de Los Angeles Lakers sobre Cleveland y de San Antonio sobre Minesota (cuota combinada de 1.4 aprox)
  • Handicaps: Lakers -15 y Washintong -6.5
Esperemos empezar bien el año

Fabricando Surebets

Hay veces que las Surebets no son tan evidentes como comparar dos cuotas y hay que 'fabricarselas' uno mismo. Eso es lo que vamos a hacer hoy con las semifinales de la copa masters que se están celebrando en Londres.

Todas las cuotas son de Pinnaclesports.

Para la segunda semifinal las cuotas ofertadas son:

  • N. Djokovic 3.090
  • R. Federer 1.437
Además tenemos que Novak está a 7.81 como ganador del torneo. Con estos datos vamos a fabricar la surebet de la siguiente forma:

1. Colocamos 10 uds a ganador del torneo a Djokovic
2. Para la semi apostaremos 23 uds a que gana Federer a cuota 1.437

Aquí tenemos dos posibilidades:

Si gana Federer la semifinal el beneficio final será, lo ganado por la apuesta menos las 10 uds apostadas a Djokovic como ganador final:
Beneficio = 23 x (1.437 - 1) - 10 = 0.05 uds

Si gana Djokovic, en la final tendremos otras dos posibilidades:

Si gana Djokovic la final el beneficio será el de la apuesta a ganador del torneo, menos lo apostado a Federer, menos lo que apostemos al otro jugador de la final:

Beneficio = 10 x (7.81 -1 ) - 23 - 43 = 2.1 uds.

Las 43 uds, las he colocado pensando que el otro jugador de la final (presumiblemente Nadal) tendrá una cuota de 1.8 como ganador del partido de la final.

Con lo que si gana ese partido nuestro beneficio sería lo ganado en esa apuesta, menos lo apostado a Djokovic como ganador de torneo, menos lo apostado a Federer.

Beneficio = 43 x (1.8 - 1) -10 -23 = 1.4 uds.

En resumen, la surebet saldrá siempre que la cuota del finalista con el que se enfrentaría Djokovic en la final sea superior a 1.73. Confiando en que sea Nadal, y viendo que la cuota en su partido de grupo estaba rondando el 1.8, es probable que así sea. Si por el contrario su oponente es Murray, la cuota no debería ser inferior a 1.8 tampoco.

Veremos si hay suerte.

Os dejo la hoja de cálculo para que el que quiera juegue un poco con los números. Creo que no me he equivocado, pero si alguien detecta algún error que me lo diga.

Rellenar SOLO LAS CELDAS EN AMARILLO

Preparando el reto de la NBA

Lamentablemente este año me ha sido absolutamente imposible seguir con el reto de la MLB y aunque sigo bastante limitado de tiempo, como habeis podido comprobar por la poca actividad del blog, me he propuesto enmendar el rumbo y hacer un reto de la NBA.

El sistema ya está preparado y durante esta semana estará en fase de prueba. Por ahora los resultados son bastante esperanzadores y espero que se mantengan durante esta semana. El reto será en base a handicaps de partidos de la NBA:

Para hoy uno de los partidos seleccionados por el sistema ha sido:

  • New Jersey Nets + 3
Durante esta semana iré colocando algún pick más en fase de prueba. Cuando el sistema esté ajustado los picks irán en el blog de los retos, que podeís encontrar pinchando en este enlace.


Edito 26-Nov-2010:
Buen comienzo, aunque como digo seguimos en pruebas, y probando estrategias. Es probable que añada una de Over/Under también, y también intentaré retomar el reto de porcentaje alto de acierto. Veremos si tengo tiempo para todo.

Vamos con un Under para hoy:

  • TOR - BOS Under 196

Predicciones MotoGp campeon 125 y F1 constructores

En esta segunda entrada vamos a completar el análisis que comenzamos hace un par de días con las predicciones de la escudería campeona del mundo de F1 y del piloto ganador en 125.

En cuanto a el campeonato de marcas, haciendo la misma gráfica de la evolución de los puntos acumulados vemos que también ajustan bastante bien las predicciones y hay dos escuderías que aparecen como favoritas, Red Bull, en azul y McLaren, en verde.


Usando las ecuaciones de regresión podemos estimar los puntos finales de cada escudería, que para la carrera 19 serían:

RED BULL = 27.381 x 19 - 23.925 => Aprox = 496
McLAREN = 24.907 x 19 + 2.725 => Aprox = 476
FERRARI = 18.634 x 19 + 17.05 => Aprox = 371

Según estos modelos de regresión Red Bull ganaría el campeonato con 20 puntos de ventaja sobre McLaren que sería segundo. Ferrari estaría casi desestimado para la victoria final, ya que las previsiones son de 125 puntos menos que Red Bull, sin embargo las casas de apuestas ofrecen cuotas por su victoria, cosa altamente improbable como comprobamos en los resultados de la simulación:


Red Bull aparece como ganador en el 93.6% de los casos y McLaren en el 6.4% restante. Ferrari no aparece como ganador en NINGUNA de las 1000 simulaciones de las tres carreras restantes realizadas.

Conclusión: Tenemos a un equipo absolutamente favorito para ganar el mundial de marcas pero si observamos las cuotas (1,02 y 12 para Red Bull y Mclaren respectivamente en Bet365) vemos que no hay value en ninguna de ellas, por lo que no haremos ningún pick para este mundial.

Con esto acabamos con la Fórmula 1 y nos pasamos a las 2 ruedas donde el único campeonato que queda por dilucidar es el de 125 en el que 3 españoles se juegan el título, Márquez, Terol y Espargaró.

Según las rectas de regresión parece que Marc (azul) tiene una ligera ventaja sobre Nico (verde) y Pol (Rojo). Las predicciones de puntos finales para los tres son:


MARQUEZ = 18.431 x 17 - 9.6593 => Aprox 303
TEROL = 16.029 x 17 + 12 => Aprox 284
ESPARGARO = 15.864 x 17 + 10.736 => Aprox 280

Utilizando el mismo sistema de simulación que para la F1 obtenemos unos resultados más apretados:


Marc sigue apareciendo como el favorito, ganando en el 53.6% de las simulaciones, mientras que Terol lo hace en el 39%. Traduciendo estos porcentajes a cuotas esperadas tenemos un gran value en la cuota de Nico, ya que las casas ofrecen cuotas superiores a 4 por su victoria en el campeonato y uno ligeramente inferior en la de Pol (cuotas dispares, algunas superiores a 15).

Conclusión:

Nico Terol campeón del mundo de 125 @ 4.2 en Bet365 Pol Espargaró campeón del mundo de 125 @ 19 en PartyBet

En tres semanas volvemos con resultados.