La cristianodependencia del Real Madrid...

... o saben los periódicos deportivos utilizar las estadísticas?. Hace un par de días el diario MARCA sacó en portada una noticia 'reveladora': Con CR9 el Real Madrid es el doble de bueno. Y subtitulaba: Estadísticamente hay cristianodependencia. La conclusión es demoledora, el Madrid marca de media 2.9 goles por partido con CR9 en el campo, mientras que cuando el portugués no ha jugado la media ha bajado a casi la mitad 1.5 goles por partido. Defensivamente ocurre algo similar, con Cristiano Ronaldo en el campo recibe una media de 0.7 goles por partido, frente a los 1.4 que reciben cuando él no juega.

Las estadísticas de MARCA son muy llamativas, pero con estos datos ¿podemos afirmar lo que dice MARCA con esa contundencia?, ¿son estas diferencias lo suficientemente grandes como para decir que no son debidas al azar?. ¿Habrían utilizado alguna herramienta estadística para confirmar esa afirmación?.

Como no eran demasiados partidos, 11 con CR9 y 10 sin él (descontando el jugado ayer en Valencia). Me puse a buscar los resultados, porque con los datos que proporcionaba MARCA, ES IMPOSIBLE saber si las diferencias son estadisticamente significativas. Así que usando las mismas herramientas que cuando analizamos el cambio de entranador, me puse a verificar si lo que MARCA afirmaba era cierto o no. Y estas son las conclusiones:

Analizando los goles a favor:


En el gráfico podemos ver que las dos 'cajas' que identifican las distribuciones de goles del Real Madrid con CR9 en el campo y sin él, tienen una separación evidente. Esta diferencia visual, que se ve claramente en el gráfico, se traduce en una diferencia estadística real y el 2 Sample T-Test así lo indica.

Analizando los datos de los goles en contra, la cosa cambia:


Aquí la distribución de los dos conjuntos de datos no es tan diferente. Las 'cajas' se solapan y esto hace que, aunque existe una diferencia entre medias, estas no sean lo suficientemente grandes como para que sean estadisticamente significativas.

Así que las diferencias que MARCA indica, son reales, pero sus conclusiones no lo son tanto. El Real Madrid marca menos goles sin Cristiano Ronaldo que con él, esto es cierto y estadisticamente esa diferencia es significativa. Pero en cuanto a los goles recibidos, aunque existe una diferencia también, estas diferencias no son lo suficientemente grandes como para decir que sean debida al factor CR9.

Bueno pues ya vemos que cada uno usa las estadísticas como quiere, y saca las conclusiones que le apetecen, unas con más valor que otras. Por eso yo, como norma general, no me suelo creer ninguna estadística que me llegan con conclusiones tan 'llamativas' como las que hemos visto y con tan pocos datos detrás para corroborarlas.

Series aleatorias en Excel


No es una práctica demasiado habitual, ni en el mundillo de las apuestas ni fuera de él, el hacer simulaciones de nuestras estrategias antes de llevarlas a la práctica. Resulta más excitante, y 'real', el hacer las pruebas con dinero que con el ordenador, aunque el resultado de estas pruebas sea absolutamente real y, en la mayoría de los casos, no tan excitante. Para intentar minimizar este efecto en nuestro bank, vamos a dar nuestros primeros pasos en la simulaciones y lo primero que debemos dominar es cómo generar numeros aleatorios. Para ello Excel dispone de varias funciones:

La funcion =aleatorio() nos devuelve un número 'pseudoaleatorio' entre [0,1). No me he equivocado con los paréntesis, es la notación matemática para decir que el número es mayor o igual que 0 y menor extricto que 1. Es decir, se acercará todo lo que queramos a 1 pero nunca nos devolverá 1. Esto se puede representar también así [0,1[

Si lo que necesitamos es obtener números aleatorios entre otros dos números diferentes deberemos utilizar la siguiente fórmula:

=aleatorio()*(B-A)+A

Esta fórmula nos va a devolver números aleatorios entre [A, B).

Utilizando la función =aleatorio.entre(A;B) obtenemos también números aleatorios entre [A, B], aunque en este caso los números que nos devuelve la función son enteros en lugar de números reales, que son los que devuelve la función aleatorio().

Estas funciones se pueden utilizar, entre otras muchas cosas, para generar resultados al azar de apuestas. Por ejemplo utilizando =aleatorio.entre(0;1) podríamos generar una columna de ceros y unos tan larga como queramos. El reparto de 0 y 1 será al 50% y se acercará más a este número cuanto mayor sea la cantidad de números generados.

Generando sólo 10 números, con un 1 más o menos podemos pasar del 50% al 60%. Este cambio en 100 números nos haría pasar de 50% a 51%, y en 1000 el cambio sería únicamente de 1 décima porcentual.

Si necesitamos obtener una distribución de 1 y 0 con un porcentaje diferente al 50%, debemos combinar la función =si(condición;resultado si verdadero;resultado si falso) con la función =aleatorio(), de esta forma:

=si(aleatorio()>0.6;1;0)

Con esta función generaremos un conjunto de unos y ceros en los que tendremos un 60% de ceros y 40% de unos. Aquí, igual que hemos comentado en el ejemplo anterior, cuanto mayor sea la cantidad de números generados mayor será la aproximación a estos porcentajes.

Algo similar podemos hacer para generar resultados de partidos de fútbol. La función ahora nos debe devolver tres valores 1, X ó 2 con los porcentajes que le marquemos. En este caso la función se complica un poco más, ya que necesitamos crear una columna para los números aleatorios y otra para la fórmula. La hoja quedaría algo así:


Para comprobar la cantidad de unos, equis y doses que ha generado, utilizaremos la función =contar.si(B2:B101;1). Esta función nos devolvería la cantidad de 1 que hay en el rango B2:B101. El porcentaje lo podemos calcular simplemente dividiendo este valor por la cantidad de números generados, que en este ejemplo son 100. Para saber la cantidad de números que hay en la columna también podemos usar la funcion =contar(A2:A101). OJO, no me he equivocado, cuento la cantidad en la columna A, que es la que contiene los números aleatorios, porque esta función cuenta la cantidad de celdas QUE CONTIENEN UN NUMERO y en la columna B tenemos números (1 y 2) y letras (X). Si queremos contar en la columna B, debemos usar =contara(B2:B101) que cuenta la cantidad de CELDAS NO VACIAS.

No me extiendo más y dejamos esta primera entrada aquí. En las siguentes seguiremos más aplicaciones de las series aleatorias en excel y su uso en simulaciones.

Representaciones gráficas de variables continuas

Seguimos con la estadística que la tenía un poco abandonada y volvemos con la representaciones gráficas de variables cuantitativas continuas. Para la representación gráfica estas variables podemos elegir una gran cantidad de gráficos. Los más útiles son los diagramas de distribución de frecuencias, frecuencias absolutas o relativas y acumulados o no, los diagramas de tallo y hoja (Steam and leaft plot en inglés) y los diagramas de caja y arbotante (box and whiskers plot). Como estos últimos tienen bastante que ver con el cálculo de valores medios y dispersión de los datos los dejaremos para cuando tratemos estos apartados en un futuro.

En esta primera entrada vamos a tratar exclusivamente de las distribuciones de frecuencia y como podemos realizarlas en Excel. Para ello vamos a utilizar el número de goles anotados por minuto en la primera parte de los partidos de primera división como ejemplo de aplicación. Los datos no son reales, pero para el que quiera y tenga tiempo en Betexplorer podeis encontrar toda la info, eso sí, hay que ir partido a partido.

Bueno supongamos que hemos hecho eso, hemos ido partido a partido copiando y pegando todos los datos de Betexplorer en Excel y al final tenemos algo así:


En la primera columna tenemos los minutos en los que se han marcado los goles y en la segunda tenemos el jugador que ha marcado.

Lo siguiente que debemos hacer es 'agrupar' los datos, pero antes tenemos que determinar el número de grupos o clases que vamos a hacer. Este es un paso realmente importante ya que si los grupos se hacen muy grandes, tendremos pocos grupos y muchos datos en cada grupo, se perderá información sobre la estructura de datos y si se hacen muy pequeños, muchos grupos y pocos datos por grupo, es difícil distinguir la tendencia de la distribución. Existen varias reglas para establecer el número de intervalos/grupos, la más extendida es la de hacer el número de grupos igual a la raiz cuadrada de la cantidad de datos disponibles. Otra regla que podemos también podemos utilizar es la regla de Sturges

Para nuestro ejemplo vamos a usar esta última, porque nos da una cantidad de grupos un poco menor que si utilizamos la de la raiz cuadrada. Para 350 datos que tenemos el número de grupos será N = 1 + 3.3 x log(350) = 9.39, aprox 9 grupos. Estos grupos es conveniente que sean de igual tamaño y mutuamente excluyentes, es decir, si tenemos registrados goles desde el minuto 0 al 45 deberemos tomar grupos de 45 / 9 = 5 Minutos. Y deberían ser 0-4, 5-9 ... Así, ningún intervalo es mayor que otro y no existen grupos que incluyan dos minutos iguales.

Ahora debemos calcular nuestra tabla de frecuencias en Excel. Y esto, como la mayoría de cosas en excel, se puede hacer de varias formas:

1. Usando la función frecuencia
2. Usando la función histograma que se encuentra dentro del complemento 'análisis de datos'
3. Usando tablas dinámicas
4. Usando subtotales
5. Usando la función contar.si

Yo voy a usar esta última, porque es la menos utilizada habitualmente en estos casos y además nos servirá para explicar una función de excel realmente potente, pero ya digo que cualquiera de las otras nos podría valer.

El resultado final es el siguiente.


En la primera columna tenemos los mintos empezando en el 0 y acabando en el 50. OJO esto es importante para el cálculo, no debemos acabar en el minuto 45 aunque en nuestros datos este sea el valor máximo. Veremos el por qué al analizar la fórmula de la columna Frecuencia Acumulada. Para el cálculo de la frecuencia acumulada usamos la función contar.si, que tiene dos parámetros. El primero es el rango de datos, en nuestro caso los datos están en el rango A1:A350. El segundo parámetro es el criterio para contar. Para la primera fila debemos contar todos las veces que aparecen números entre 0 y 4, es decir, número de minuto menor que 5. Esto lo podría haber hecho así directamente =contar.si(A1:A350;"<5"). Si utilizamos esta función obtendremos el mismo resultado, pero, en primer lugar, es más lento de programar, ya que debo ir cambiando el criterio para cada fila de mi tabla y en segundo lugar es mucho menos flexible. De la manera que lo hemos hecho cambiando el valor de las celdas de la columna E nos va a cambiar el criterio y nos acutalizará los datos automáticamente. Además la tabla la rellenamos mucho más rápidamente copiando la fórmula a toda la columna. El valor del minuto 50 lo necesitamos ya que el calculo del último intervalo excluye (el menor es estricto, no es menor o igual) al minuto 45 y muchos de los goles que tenemos contabilizados se han marcado en ese minuto, que incluye también los goles marcados en tiempo añadido.

La última columna es la frecuencia sin acumular y su cálculo es sencillo, como se muestra en la imagen. Con esto tenemos acabada nuestra tabla de frecuencias y podemos representar gráficamente los datos. El resultado final es el siguiente


Para el cálculo de las frecuencias relativas debemos dividir cada uno de los valores de nuestra tabla por el total de datos, en nuestro caso 350. Y las graficas que se obtienen son exactamente iguales lo único que nos cambiaría es la escala del eje Y, que pasaría a ser de 0 a 100%.

Bueno, lo dejamos aquí por hoy y si teneis alguna duda o quereís alguna aclaración ya sabeis como contactar conmigo. Un saludo.

Buscando la mejor cuota: Apuestas similares

Hace algún tiempo leí, no recuerdo bien donde, algo que me llamó mucho la atención. Las casas de apuestas tienen muchas ventajas sobre los apostadores, manejan más información y normalmente más precisa, tienen muchos datos para analizar y predecir resultados, tienen a mucha gente trabajando para ellos, ofrecen cuotas que por lo general tienen una esperanza de premio negativa..., pero hay una cosa que en la que los apostadores tenemos ventaja sobre las casas: las casas deben sacar cuotas por obligación. No hay elección, si quieren ganar dinero deben ofrecer cuotas, y muchas veces la mentalidad de la casa es ofrecer cuantas más cuotas mejor. Esto es un gran punto a favor del apostante, porque las cuotas no se pueden ofrecer a la ligera ya que algunas están relacionadas entre si. Es lo que yo llamo apuestas similares. Entre ellas distingo dos casos, las idénticas y las 'parecidas'. Vamos empezar con las primeras.

Las apuestas idénticas las podemos encontrar entre distintas casas de apuestas e incluso dentro de la misma casa. Las más evidentes son las que se dan entre apuestas a favor (back) y en contra (lay). Este último tipo de apuestas solo se pueden encontrar en casas de intercambio de apuestas del estilo de Betfair. La manera más sencilla de entender las apuestas en contra es pensar que cuando hacemos un 'lay' estamos apostando a algo que creemos que no va a suceder. Es decir, un lay a Federer @ 2.1 en su partido contra Nadal, significa que creemos que Federer no va a ganar a Nadal, o lo que es lo mismo que Nadal gana el partido (ofrecido @ 1.75). Así las apuestas idénticas en este caso serían:

Lay Federer = Back Nadal

El problema de este tipo de apuestas similares-idénticas es que no podemos comparar las cuotas directamente, como haremos con dos apuestas idénticas a favor (Back). Para poder determinar cual de ellas es más interesante debemos convertir el Lay a Back o viceversa, mediante la siguiente fórmula:

Back = 1 + 1/(Lay -1)

Así en el ejemplo anterior el

Back = 1 + 1/(2.1 - 1) = 1 + 1/1.1 = 1.91

¿Que quiere decir esto?, pues que la apuesta Lay Federer @ 2.1 es más rentable que el Back a Nadal a 1.75

Este tipo de apuestas similares también se pueden dar con apuestas a favor (back) solamente, bien en varias casas o bien en una misma.
  • Una apuesta a que ambos equipos NO marcan en el partido es idéntica a una apuesta a resultado 0-0.
  • Una apuesta a que en un partido a 3 sets Fernando Verdasco gana al menos un set es lo mismo que un handicap 1.5 a favor de Verdasco.
  • Un handicap 1:0 del Spartak sobre el Manchester es una apuesta idéntica a un 1X.
En cualquiera de estos tres casos una comparación directa de las cuotas nos valdrá para identificar la mejor de ellas.

Esta última apuesta también sería idéntica a dos apuestas individuales una al 1 y otra a la X. Pero en estos casos deberemos hacer un cálculo de la cuota equivalente. Veamos como se puede hacer con los datos del partido de Champions League entre el Lyon y el Liverpool:


Una vez tenemos calculadas las probabilidades de cada opción y las hemos transformado en probabilidades unitarias. El calculo de la cuota equivalente es sencillo, simplemente multiplicamos cualquiera de las probabilidades unitarias por su cuota:


Buscamos ahora la cuota para el 1X y la casa nos la da a 1.30, con lo que en este caso deberíamos optar por las apuestas individuales en lugar de jugar la combinada que nos propone la casa. El porcentaje del total apostado que debemos colocar a cada uno de los resultados es el que tenemos en la columna de probabilidad unitaria.

Con el sistema de combinar cuotas podéis sacar otras muchas apuestas idénticas, entre overs, resultado par o impar, o handicaps, y resultados exactos de partidos.

Lo vamos a dejar aquí por hoy porque no quiero hacer la entrada demasiado extensa y en la siguiente veremos las apuestas 'similares', que también su gracia.

Combi 3 o la lotería que siempre toca

Tenía casi finalizada la entrada para esta semana, pero la voy a aparcar para mañana o el lunes porque esta noticia me ha dejado alucinado.

Esto es un pequeño ejemplo de como buscarle las cosquillas a un bookie, en este caso la loteria de catalunya.

¿Tendrá algo que ver el tio que ideó el juego con el que ha sellado más de un boleto con la misma combinación?.

El resumen es que por cada de 228 Euros tenías un premio garantizado de 3.000 Euracos, nada más y nada menos que una SUREBET de cuota 13!!!!.

Lástima no haberme enterado a tiempo.

Vivir para ver!!!!!

Cuatro consejos más

Siguiendo con los post de consejos para principiantes y no tan principiantes, en sportsinsights tienen un artículo en el que ofrecen 4 consejos que me han parecido realmente interesantes. Alguno de ellos ya lo hemos tratado aquí en otros post, pero nunca viene mal recordarlos. Este es un pequeño resumen del artículo.

1. Buscar siempre las mejores cuotas:
La explicación de esta estrategia ya la hemos dado en post anteriores. La idea es observar a los bookies como cuando estamos de compras en un supermercado, miramos los precios de los productos que nos interesan y elegimos, por norma general, el sitio que más barato nos los ofrece. En las apuestas la intención es la misma. Escoger el bookie que más rentabilidad me va a dar a mi apuesta.

2. Apuesta en contra de la mayoría:
Esta me ha parecido muy interesante. En la propia página de Sportinsights tienen sus propios datos que corroboran esta estrategia e incluso existen artículos cientificos sobre el resultado de apostar a no favoritos en la MLB que también apuntan a que esta estrategia da resultados positivos a largo plazo.

La explicación es simple. Es evidente que a la mayoría nos gusta apostar a ganadores, los bookies lo saben y para distribuir el dinero en una apuesta suelen ofrecer cuotas atractivas a los no favoritos (dogs o under-dogs en inglés). Como ya hemos visto la cuota está relacionada con la probabilidad del suceso, así que, una cuota que ha subido mucho puede llegar a ser un value importante.

Esta es una estrategia complicada de llevar porque normalmente tendremos más fallos que aciertos, pero, teóricamente, los aciertos, al ser a cuotas relativamente altas, deben compensar las pérdidas de los eventos fallados.

3. Porcentajes de Apuestas:
En Sportsinsights ofrecen datos de las cantidades de dinero apostadas en cada uno de los eventos. Esta información sirve para interpretar como se está moviendo el mercado y puede ayudar a seleccionar mejor nuestras apuestas.

4. Apostar a Favoritos al principio y a No favoritos al final:
Este consejo tiene relación con lo que hemos comentado en el segundo punto. Cuando la casa saca las cuotas al mercado, se supone que ha hecho una estimación correcta de las probabilidades de victoria de cada equipo. Sin embargo las cantidades de dinero asociadas a cada una de las apuestas no se suelen comportar conforme a lo que las casas les interesa, con lo que deben mover las cuotas. Así, al cabo de unas horas las cuotas de los favoritos del público habrán bajado y las de los no favoritos habrán subido.

Esto es lo que comentaba en el chat con Inmortal, es probable que alguna vez siguiendo un pick de algun tipster os hayais encotrado que la cuota que tiene el pick no corresponde con la ofrecida por la casa. Casi siempre la cuota habrá bajado. En estos casos, deberíamos 'aparcar' el pick o incluso ir en contra. Con ello probablemente, consigueremos mejores resultados que siguiendo el pick a una cuota más baja. ¿Como es esto posible, si el tipster tiene rentabilidades positivas?. Vamos a intentar explicarlo con un ejemplo:

Supongamos que una casa nos ofrece la posibilidad de apostar en el lanzamiento de una moneda y nos ofrece:

2.1 Para la cara
1.9 Para la cruz

El tipster nos ofrece como pick Cara @2.1, y también será la opción elegida por la mayoría de gente, con lo que las cantidades de dinero apostadas para este resultado serán mucho mayores que para la cruz. La casa de apuestas cuando detecta esta descompensación intenta regular la situación cambiando las cuotas.:

1.9 Cara
2.1 Cruz

El pick Cara @ 2.1 ofrecido al principio por el tipster era 'rentable' (tenía value), pero al cambiar la cuota a 1.9, el pick ha pasado a no tener value. Y lo contrario ha pasado al resultado Cruz, ha pasado de no ser rentable a ser el value de la apuesta.


En la siguiente entrada veremos otra manera de entender el primer punto: buscar siempre la mejor cuota, analizando apuestas 'similares' ofrecidas incluso por la misma casa.

¿Para qué sirve la Estadistica?

A pesar de ser esta una cuestión planteada ya en el pasado y sobre la que ya escribimos un post, voy a dedicar alguna que otra entrada más para intentar responder a esta pregunta, cuya búsqueda en google es una de las fuentes de visitas más importantes de este blog. Si haceis la prueba y vais a google y tecleais la pregunta, en primer lugar vais a obtener una página de este blog, y en segundo (la he adelantado en los últimos meses), una página alojada en galeón.

Allí podreis encontrar una buena cantidad de ejemplos de las diferentes aplicaciones de la estadística. Estas probablemente sean las que cualquier buen profesor de universidad os indicaría si le haceis esta pregunta. Pero la estadística, aunque parezca increible, tiene también su parte lúdica.

A través de ella se puede llegar a contestar a preguntas como como:

  • ¿Qué resulta más peligroso: una pistola o una piscina?
  • ¿Qué tienen en común un maestro de escuela y un luchador de sumo?
  • ¿Por qué continúan los traficantes de drogas viviendo con sus madres?
  • ¿En qué se parece el Ku Klux Klan a los agentes inmobiliarios?

No es broma, son las preguntas que se han hecho Steven D. Levitt y Stephen J. Dubner, y a las que han dado respuesta en su libro Freakonomics. Recomendable 100% para todo el mundo, no solo para economistas, o matemáticos, porque no tiene prácticamente ninguna demostración científica y es realmente entretenido de leer. En el libro se muestan una serie de ejemplos prácticos en los se ha utilizado la estadística para responder a preguntas de lo más singulares. Es una especie de pensamiento lateral (thinking outside the box, en ingés) con base matemática. Se trata de estirar y estrujar datos hasta sus límites más insospechados para obtener resultados sorprendentes. Como dicen ellos LAS COSAS A VECES NO SON LO QUE PARECEN.

Algo similar hemos intentado en el blog, en una escala un poco menor, cuando planteabamos la pregunta de si el Real Madrid ha cambiado su estilo de juego. Al final pudimos demostrar con el análisis de unos pocos partidos que los entrenadores que había tenido el Real Madrid era un factor significativo en cuanto a la cantidad de goles que marcaba y recibía el equipo.

La estadistica sirve para esto y para otras muchas cosas, bastantes más de lo que la gente piensa. En futuros post iremos poniendo ejemplos del uso de la estadistica, sus aplicaciones y los resultados que puede proporcionar, en algunos casos realmente sorprendentes.