Mostrando entradas con la etiqueta Curso Básico. Mostrar todas las entradas
Mostrando entradas con la etiqueta Curso Básico. Mostrar todas las entradas

El P-Value en las apuestas

Bueno, como comentaba en la anterior entrada, vamos con esta segunda parte en la que seguiremos hablando de los test de hipótesis y el P-Value, pero ahora centrado en el tema de las apuestas, que es el motivo por el que me planteé escribir estos dos post.

Ya vimos en la entrada inicial, que el P-Value se obtenía como resultado de un test de hipótesis con el que valorábamos las diferencias encontradas entre DOS variables. El P-Value nos da una indicación sobre la probabilidad de que esas diferencias que hemos encontrado al hacer el test sean reales o sean fruto del azar. Si las diferencias encontradas son muy grandes, el P-Value será muy pequeño y, por tanto, nos está indicando que la probabilidad de que esas diferencias sean fruto del azar es muy baja.

Hay una gran variedad de test de hipótesis y cada uno de ellos se debe usar en función de las variables o los datos que tengamos que comparar. Podemos usarlos para comparar si el cambio de entrenador en el Real Madrid ha influido en la cantidad de goles que anota y que recibe el equipo, como hicimos en este post, o si el rendimiento de un bateador de la MLB podría estar afectado por el color de sus ojos, o si el Real Madrid, en su época, tenía una cristiano-dependencia. En todos ellos los test de hipótesis se usaron para comparar dos situaciones diferentes y concluir si las diferencias entre ellas eran estadisticamente significativas o no. En algunos casos vimos que SI, que había unas diferencias importantes y los P-Value que obteníamos eran muy bajos, con lo que SI podíamos decir que, con un grado de confianza del 95%, esas dos situaciones eran diferentes, pero en otros casos no encontramos diferencias lo suficientemente importantes.

Lo mismo nos pasaba en la entrada anterior, donde hice el supertest UsainBoltiano y me comparaba con velocista jamaicano. El test prácticamente no encontró ninguna diferencia entre Usain y yo. Cuando pasa esto, NO PODEMOS DECIR que esas dos variables que comparamos sean IGUALES, es decir, no podíamos decir que yo soy Usain Bolt, y debemos decir que no hemos encontrado diferencias suficientes para poder asegurar que son distintas. En estas circunstancias, nuestro siguiente paso seria valorar la 'potencia de nuestro test'. Debemos confirmar, si nuestro test es lo suficientemente potente como para encontrar las diferencias que estamos buscando.

Este es el primer problema de los test de hipotesis, que SIEMPRE comparan algo para buscar diferencias, y si no se encuentran esas diferencias, tenemos que confirmar si no las hemos encontrado porque en realidad no las hay o no las hemos encontrado porque nuestro test era una castaña (como asi era en el test de Usain Bolt).

El segundo problema de los test de hipótesis es SABER QUÉ COMPARAMOS. Y aquí es donde entra el tema de las apuestas.

Hace unos meses me topé con un post en Twitter, que me dejó un poco mosca, en el que un tipster hablaba de sus resultados y del P-Value.  Y el remate final fue cuando vi este mensaje de la gente de Pyckio. En ese momento, me quede como un conejo cuando le dan las largas. Hacian un reto contra uno de sus mejores tipsters en el que el ganador se iba a valorar en función del P-Value. 

Me puse a investigar y descubrí que hay un fichero Excel creado por Miguel Figueres que introduciendo 4 datos te devuelve un P-Value. Este P-Value traducido al lenguaje apuestil representa la probabilidad de que los resultados de tu estrategia de picks se deba al azar. Fascinante!!!!.

Pues manos a la obra, voy a meter mis datos a ver que pasa, 975 apuestas, Yield de 0.5, Promedio ponderado de apuestas 3,5 y stake medio 1:


Le doy al enter.... y tras unos segundos de tensa espera, aquí tengo mi resultado:


P-VAlue de 0,000%, eso no lo supera ni el super tipster de Pyckio, soy un TOTAL PRO!!!. Con estos datos estoy seguro que la gran mayoría de vosotros seguiríais mis picks a ciegas. Pues craso error.  Esos picks han sido, 974 apuestas a cuota 2 con stake 1 en la que solo he acertado UNA!!! y, como ya estaba hasta las narices de perder, tras 974 apuestas hice la apuesta 975, que fue una megacombinada a  cuota 1500 y me tocó la lotería, como al finlandés con el podio de la F1 en Monza hace unos dias. Mas azar que esto no puede haber en una estrategia de apuestas, y sin embargo el resultado de los cálculos de fichero me dice que NO, que mis resultados no pueden ser por suerte. ¿Como se explica esto?.

Pues muy fácil, el test que hace el fichero es un test en el que se comparan los resultados de mis apuestas con una función que podemos llamar apuestas medias ponderadas, en mi caso, los resultados de mis apuestas no se parecen ni por lo más remoto a esa función, con lo que el P-Value es enano. ¿Quiere decir eso que mis resultados no han sido fruto de la casualidad?, PUES NO, NO y MIL QUINIENTAS VECES NO. Lo que quiere decir es que los resultados de mis apuestas no se parecen en nada a la función con la que lo comparo y punto.

Así que sintiéndolo mucho, por ahora no he encontrado a nadie que tenga la varita mágica del P-Value en las apuestas, sencilla y llanamente porque NO SE PUEDE MODELIZAR LOS RESULTADOS DE LA FUNCION AZAR que serían los que tendríamos que comparar con nuestras apuestas.

Podría haber un caso en el que se podría hacer algo pero eso lo dejo para otro post, si a alguno de vosotros os interesa.



Los Test de Hipotesis, el P-Value y Usain Bolt

Usaint
Hace algunos años, en este post, explicaba cómo se podía hacer un test de normalidad en Excel y en él hacía mención a lo que en estadística inferencial se llama el p-value. El p-value, como su propio nombre indica, es un 'valor' que se obtiene como resultado de un test de hipótesis, en el que se suele plantear una disyuntiva entre dos alternativas. 
Voy a intentar ser lo más elemental posible en este post para que se pueda entender de manera fácil. 
Imaginemos que lo que queremos analizar es si yo soy Usain Bolt o no. Para ello haremos un test en el que planteamos dos hipótesis:
  • La hipótesis nula (H0) sería que yo soy Usain Bolt
  • La hipótesis alternativa (H1) sería que no lo soy
 Ahora nuestro test de hipótesis lo que hace es: 
  • Vale, voy a darte el beneficio de la duda y vamos a partir de la base que SI lo eres. Ahora voy a usar mis métodos para intentar encontrar pruebas (diferencias) y dependiendo de lo grandes que sean esas diferencias te diré si deberías rechazar H0 o no.  ¡¡OJO!!, no digo aceptar, digo rechazar o no, la explicación a esto la veréis más abajo.
Bien, pues vamos con nuestro test que pretende encontrar esas diferencias. El test consiste en las siguientes 10 preguntas:
  1. ¿Eres hombre?
  2. ¿Eres negro?
  3. ¿Tienes dos piernas?
  4. ¿Has asistido alguna vez a unos juegos olímpicos?
  5. ¿Tienes hermanos?
  6. ¿De pequeño jugabas al futbol?
  7. ¿Te gustaría jugar en el Manchester United?
  8. ¿Te gusta la música?
  9. ¿Juegas al dominó?
  10. ¿Has corrido alguna vez la prueba de 1500 m?
 Las respuestas a esas preguntas si se las hiciésemos a Usain serían todo Sies menos la última que es un No.
Si me las hago a mí, la respuestas son todo sies menos la segunda y la última.
Es decir que el 90% de mis respuestas coinciden con las de Usain. Este test, no ha conseguido encontrar practicamente ninguna diferencia entre Usain y yo. Con estos resultados, el p-value que obtendríamos estaría bastante por encima del 0.05 que suele ser el valor de corte utilizado para rechazar o no la hipótesis nula.
A la vista de estos datos, MUCHA GENTE diría, como el p-value es mayor que 0.05 (lo que se denomina nivel de significación) aceptamos H0 como válida, lo que equivale a asegurar que SOY USAIN BOLT.
Lamento decepcionaros, pero evidentemente no lo soy.
Uy, pero entonces, ¿Que ha pasado?. Pues muy fácil, mi test es tan sumamente malo que no encontraría diferencias significativas entre cualquier hombre de este país y Usain Bolt. Así de sencillo.
Cuando obtenemos este tipo de resultados en un test de hipótesis, EN LUGAR DE ACEPTAR H0, lo que se DEBE DECIR es que no hemos encontrado diferencias suficientes para RECHAZAR H0 y lo que nos debemos plantear en este caso es si nuestro test es suficientemente potente como para encontrar esas diferencias. Como todos vosotros coincidiréis y viendo esta patata de test, la respuesta a la pregunta es un rotundo NO.
Cualquiera de vosotros puede encontrar otra batería de 10 preguntas, o de menos incluso, que permita identificar, con una certeza casi absoluta, si la persona que responde al test es o no es Usain Bolt. He de reconocer que me ha costado encontrar 10 preguntas para hacer el chapuza test este, buscando información sobre Usain hay miles de cosas que preguntar que nos distinguirían de inmediato entre uno y otro.
Como no quiero hacerlo muy largo, por hoy, lo dejamos aquí y en el siguiente post veremos la relación entre el p-value y las apuestas, que es algo que en Twitter está muy de moda.

Apostando a ciegas

Recuerdo que hace un par de meses recibí un mail de un visitante del blog que me comentaba que era nuevo en este mundo de las apuestas y que antes de abrir ninguna cuenta y comenzar a arriesgar su dinero había estado leyendo e informándose sobre todo lo concerniente a las apuestas deportivas. Esta es una postura que me parece de lo más razonable y, aunque sé que no es lo habitual, sería lo deseable para todo aquel que decida iniciarse en este mundo.

También me indicaba que, como su experiencia era limitada, se había planteado empezar copiando picks de tipsters con números positivos y estables a largo plazo. Esto tampoco me parecía una mala opción y así se lo comenté en mi mail de contestación.

Al cabo de unas semanas llegó la hora de hacer balance de sus primeros pasos y pese haber seguido religiosamente los picks de los tipsters, su YIELD no era comparable. Esto le llamó poderosamente la atención y me preguntaba intrigado, como podía ser posible, si había hecho exactamente lo que el tipster indicaba.

La respuesta es bien sencilla. Descartando el hecho de que hubiese cometido alguna imprudencia con los stakes, la clave estaba en las cuotas. Apostar ciegamente a los picks que ofrecen ciertas páginas o tipsters no tiene ningún sentido si no consideramos las cuotas y los stakes. Un pick puede pasar de ser un buen value, a ser una apuesta de alto riesgo, simplemente porque la cuota que hemos encontrado es inferior a la que indica el pick. Este cambio en la cuota puede venir provocado bien porque ha bajado desde que el tipster publicó su selección o bien porque nuestra casa tiene cuotas inferiores a la casa en la que el tipster juega habitualmente. Independientemente de uno u otro motivo el resultado final es siempre el mismo.

La demostración matemática de este hecho no resulta complicada.

Apostando una cantidad fija (K) a una cuota fija (C) el YIELD se puede reducir a calcular:
YIELD = C x % medio de aciertos - 1
Jugando un poco con los números, si nuestro tipster estrella tiene un porcentaje de aciertos del 54% en eventos a cuota 1.95 su YIELD será de:

YIELD = 1.95 x 54% - 1 = 5.3%

Si nosotros seguimos ciegamente sus apuestas, tenemos, como es lógico, el mismo % de acierto, 54%, pero para nuestra desgracia la cuota media de nuestros picks se ha visto reducida hasta un pobre 1.85. Con estos números:

YIELD = 1.85 x 54% - 1 = -0.1%

Así pues, mientras el tipster estrella va incrementando su bank constantemente, nosotros, con los mismos picks, aciertos y stakes, nos vamos moviendo en el filo de la navaja y una mala racha del tipster nos empujará hacia el abismo rojo.

Por todo ello, mi consejo es NO APOSTAR si no encontramos cuotas idénticas o superiores a la de los picks de los tipsters a los que nos gusta seguir. Es decir, NO APOSTAR A CIEGAS a algo por el mero hecho de que un gurú de las apuestas así lo indica.

Series aleatorias en Excel


No es una práctica demasiado habitual, ni en el mundillo de las apuestas ni fuera de él, el hacer simulaciones de nuestras estrategias antes de llevarlas a la práctica. Resulta más excitante, y 'real', el hacer las pruebas con dinero que con el ordenador, aunque el resultado de estas pruebas sea absolutamente real y, en la mayoría de los casos, no tan excitante. Para intentar minimizar este efecto en nuestro bank, vamos a dar nuestros primeros pasos en la simulaciones y lo primero que debemos dominar es cómo generar numeros aleatorios. Para ello Excel dispone de varias funciones:

La funcion =aleatorio() nos devuelve un número 'pseudoaleatorio' entre [0,1). No me he equivocado con los paréntesis, es la notación matemática para decir que el número es mayor o igual que 0 y menor extricto que 1. Es decir, se acercará todo lo que queramos a 1 pero nunca nos devolverá 1. Esto se puede representar también así [0,1[

Si lo que necesitamos es obtener números aleatorios entre otros dos números diferentes deberemos utilizar la siguiente fórmula:

=aleatorio()*(B-A)+A

Esta fórmula nos va a devolver números aleatorios entre [A, B).

Utilizando la función =aleatorio.entre(A;B) obtenemos también números aleatorios entre [A, B], aunque en este caso los números que nos devuelve la función son enteros en lugar de números reales, que son los que devuelve la función aleatorio().

Estas funciones se pueden utilizar, entre otras muchas cosas, para generar resultados al azar de apuestas. Por ejemplo utilizando =aleatorio.entre(0;1) podríamos generar una columna de ceros y unos tan larga como queramos. El reparto de 0 y 1 será al 50% y se acercará más a este número cuanto mayor sea la cantidad de números generados.

Generando sólo 10 números, con un 1 más o menos podemos pasar del 50% al 60%. Este cambio en 100 números nos haría pasar de 50% a 51%, y en 1000 el cambio sería únicamente de 1 décima porcentual.

Si necesitamos obtener una distribución de 1 y 0 con un porcentaje diferente al 50%, debemos combinar la función =si(condición;resultado si verdadero;resultado si falso) con la función =aleatorio(), de esta forma:

=si(aleatorio()>0.6;1;0)

Con esta función generaremos un conjunto de unos y ceros en los que tendremos un 60% de ceros y 40% de unos. Aquí, igual que hemos comentado en el ejemplo anterior, cuanto mayor sea la cantidad de números generados mayor será la aproximación a estos porcentajes.

Algo similar podemos hacer para generar resultados de partidos de fútbol. La función ahora nos debe devolver tres valores 1, X ó 2 con los porcentajes que le marquemos. En este caso la función se complica un poco más, ya que necesitamos crear una columna para los números aleatorios y otra para la fórmula. La hoja quedaría algo así:


Para comprobar la cantidad de unos, equis y doses que ha generado, utilizaremos la función =contar.si(B2:B101;1). Esta función nos devolvería la cantidad de 1 que hay en el rango B2:B101. El porcentaje lo podemos calcular simplemente dividiendo este valor por la cantidad de números generados, que en este ejemplo son 100. Para saber la cantidad de números que hay en la columna también podemos usar la funcion =contar(A2:A101). OJO, no me he equivocado, cuento la cantidad en la columna A, que es la que contiene los números aleatorios, porque esta función cuenta la cantidad de celdas QUE CONTIENEN UN NUMERO y en la columna B tenemos números (1 y 2) y letras (X). Si queremos contar en la columna B, debemos usar =contara(B2:B101) que cuenta la cantidad de CELDAS NO VACIAS.

No me extiendo más y dejamos esta primera entrada aquí. En las siguentes seguiremos más aplicaciones de las series aleatorias en excel y su uso en simulaciones.

Representaciones gráficas de variables continuas

Seguimos con la estadística que la tenía un poco abandonada y volvemos con la representaciones gráficas de variables cuantitativas continuas. Para la representación gráfica estas variables podemos elegir una gran cantidad de gráficos. Los más útiles son los diagramas de distribución de frecuencias, frecuencias absolutas o relativas y acumulados o no, los diagramas de tallo y hoja (Steam and leaft plot en inglés) y los diagramas de caja y arbotante (box and whiskers plot). Como estos últimos tienen bastante que ver con el cálculo de valores medios y dispersión de los datos los dejaremos para cuando tratemos estos apartados en un futuro.

En esta primera entrada vamos a tratar exclusivamente de las distribuciones de frecuencia y como podemos realizarlas en Excel. Para ello vamos a utilizar el número de goles anotados por minuto en la primera parte de los partidos de primera división como ejemplo de aplicación. Los datos no son reales, pero para el que quiera y tenga tiempo en Betexplorer podeis encontrar toda la info, eso sí, hay que ir partido a partido.

Bueno supongamos que hemos hecho eso, hemos ido partido a partido copiando y pegando todos los datos de Betexplorer en Excel y al final tenemos algo así:


En la primera columna tenemos los minutos en los que se han marcado los goles y en la segunda tenemos el jugador que ha marcado.

Lo siguiente que debemos hacer es 'agrupar' los datos, pero antes tenemos que determinar el número de grupos o clases que vamos a hacer. Este es un paso realmente importante ya que si los grupos se hacen muy grandes, tendremos pocos grupos y muchos datos en cada grupo, se perderá información sobre la estructura de datos y si se hacen muy pequeños, muchos grupos y pocos datos por grupo, es difícil distinguir la tendencia de la distribución. Existen varias reglas para establecer el número de intervalos/grupos, la más extendida es la de hacer el número de grupos igual a la raiz cuadrada de la cantidad de datos disponibles. Otra regla que podemos también podemos utilizar es la regla de Sturges

Para nuestro ejemplo vamos a usar esta última, porque nos da una cantidad de grupos un poco menor que si utilizamos la de la raiz cuadrada. Para 350 datos que tenemos el número de grupos será N = 1 + 3.3 x log(350) = 9.39, aprox 9 grupos. Estos grupos es conveniente que sean de igual tamaño y mutuamente excluyentes, es decir, si tenemos registrados goles desde el minuto 0 al 45 deberemos tomar grupos de 45 / 9 = 5 Minutos. Y deberían ser 0-4, 5-9 ... Así, ningún intervalo es mayor que otro y no existen grupos que incluyan dos minutos iguales.

Ahora debemos calcular nuestra tabla de frecuencias en Excel. Y esto, como la mayoría de cosas en excel, se puede hacer de varias formas:

1. Usando la función frecuencia
2. Usando la función histograma que se encuentra dentro del complemento 'análisis de datos'
3. Usando tablas dinámicas
4. Usando subtotales
5. Usando la función contar.si

Yo voy a usar esta última, porque es la menos utilizada habitualmente en estos casos y además nos servirá para explicar una función de excel realmente potente, pero ya digo que cualquiera de las otras nos podría valer.

El resultado final es el siguiente.


En la primera columna tenemos los mintos empezando en el 0 y acabando en el 50. OJO esto es importante para el cálculo, no debemos acabar en el minuto 45 aunque en nuestros datos este sea el valor máximo. Veremos el por qué al analizar la fórmula de la columna Frecuencia Acumulada. Para el cálculo de la frecuencia acumulada usamos la función contar.si, que tiene dos parámetros. El primero es el rango de datos, en nuestro caso los datos están en el rango A1:A350. El segundo parámetro es el criterio para contar. Para la primera fila debemos contar todos las veces que aparecen números entre 0 y 4, es decir, número de minuto menor que 5. Esto lo podría haber hecho así directamente =contar.si(A1:A350;"<5"). Si utilizamos esta función obtendremos el mismo resultado, pero, en primer lugar, es más lento de programar, ya que debo ir cambiando el criterio para cada fila de mi tabla y en segundo lugar es mucho menos flexible. De la manera que lo hemos hecho cambiando el valor de las celdas de la columna E nos va a cambiar el criterio y nos acutalizará los datos automáticamente. Además la tabla la rellenamos mucho más rápidamente copiando la fórmula a toda la columna. El valor del minuto 50 lo necesitamos ya que el calculo del último intervalo excluye (el menor es estricto, no es menor o igual) al minuto 45 y muchos de los goles que tenemos contabilizados se han marcado en ese minuto, que incluye también los goles marcados en tiempo añadido.

La última columna es la frecuencia sin acumular y su cálculo es sencillo, como se muestra en la imagen. Con esto tenemos acabada nuestra tabla de frecuencias y podemos representar gráficamente los datos. El resultado final es el siguiente


Para el cálculo de las frecuencias relativas debemos dividir cada uno de los valores de nuestra tabla por el total de datos, en nuestro caso 350. Y las graficas que se obtienen son exactamente iguales lo único que nos cambiaría es la escala del eje Y, que pasaría a ser de 0 a 100%.

Bueno, lo dejamos aquí por hoy y si teneis alguna duda o quereís alguna aclaración ya sabeis como contactar conmigo. Un saludo.

Buscando la mejor cuota: Apuestas similares

Hace algún tiempo leí, no recuerdo bien donde, algo que me llamó mucho la atención. Las casas de apuestas tienen muchas ventajas sobre los apostadores, manejan más información y normalmente más precisa, tienen muchos datos para analizar y predecir resultados, tienen a mucha gente trabajando para ellos, ofrecen cuotas que por lo general tienen una esperanza de premio negativa..., pero hay una cosa que en la que los apostadores tenemos ventaja sobre las casas: las casas deben sacar cuotas por obligación. No hay elección, si quieren ganar dinero deben ofrecer cuotas, y muchas veces la mentalidad de la casa es ofrecer cuantas más cuotas mejor. Esto es un gran punto a favor del apostante, porque las cuotas no se pueden ofrecer a la ligera ya que algunas están relacionadas entre si. Es lo que yo llamo apuestas similares. Entre ellas distingo dos casos, las idénticas y las 'parecidas'. Vamos empezar con las primeras.

Las apuestas idénticas las podemos encontrar entre distintas casas de apuestas e incluso dentro de la misma casa. Las más evidentes son las que se dan entre apuestas a favor (back) y en contra (lay). Este último tipo de apuestas solo se pueden encontrar en casas de intercambio de apuestas del estilo de Betfair. La manera más sencilla de entender las apuestas en contra es pensar que cuando hacemos un 'lay' estamos apostando a algo que creemos que no va a suceder. Es decir, un lay a Federer @ 2.1 en su partido contra Nadal, significa que creemos que Federer no va a ganar a Nadal, o lo que es lo mismo que Nadal gana el partido (ofrecido @ 1.75). Así las apuestas idénticas en este caso serían:

Lay Federer = Back Nadal

El problema de este tipo de apuestas similares-idénticas es que no podemos comparar las cuotas directamente, como haremos con dos apuestas idénticas a favor (Back). Para poder determinar cual de ellas es más interesante debemos convertir el Lay a Back o viceversa, mediante la siguiente fórmula:

Back = 1 + 1/(Lay -1)

Así en el ejemplo anterior el

Back = 1 + 1/(2.1 - 1) = 1 + 1/1.1 = 1.91

¿Que quiere decir esto?, pues que la apuesta Lay Federer @ 2.1 es más rentable que el Back a Nadal a 1.75

Este tipo de apuestas similares también se pueden dar con apuestas a favor (back) solamente, bien en varias casas o bien en una misma.
  • Una apuesta a que ambos equipos NO marcan en el partido es idéntica a una apuesta a resultado 0-0.
  • Una apuesta a que en un partido a 3 sets Fernando Verdasco gana al menos un set es lo mismo que un handicap 1.5 a favor de Verdasco.
  • Un handicap 1:0 del Spartak sobre el Manchester es una apuesta idéntica a un 1X.
En cualquiera de estos tres casos una comparación directa de las cuotas nos valdrá para identificar la mejor de ellas.

Esta última apuesta también sería idéntica a dos apuestas individuales una al 1 y otra a la X. Pero en estos casos deberemos hacer un cálculo de la cuota equivalente. Veamos como se puede hacer con los datos del partido de Champions League entre el Lyon y el Liverpool:


Una vez tenemos calculadas las probabilidades de cada opción y las hemos transformado en probabilidades unitarias. El calculo de la cuota equivalente es sencillo, simplemente multiplicamos cualquiera de las probabilidades unitarias por su cuota:


Buscamos ahora la cuota para el 1X y la casa nos la da a 1.30, con lo que en este caso deberíamos optar por las apuestas individuales en lugar de jugar la combinada que nos propone la casa. El porcentaje del total apostado que debemos colocar a cada uno de los resultados es el que tenemos en la columna de probabilidad unitaria.

Con el sistema de combinar cuotas podéis sacar otras muchas apuestas idénticas, entre overs, resultado par o impar, o handicaps, y resultados exactos de partidos.

Lo vamos a dejar aquí por hoy porque no quiero hacer la entrada demasiado extensa y en la siguiente veremos las apuestas 'similares', que también su gracia.

Cuatro consejos más

Siguiendo con los post de consejos para principiantes y no tan principiantes, en sportsinsights tienen un artículo en el que ofrecen 4 consejos que me han parecido realmente interesantes. Alguno de ellos ya lo hemos tratado aquí en otros post, pero nunca viene mal recordarlos. Este es un pequeño resumen del artículo.

1. Buscar siempre las mejores cuotas:
La explicación de esta estrategia ya la hemos dado en post anteriores. La idea es observar a los bookies como cuando estamos de compras en un supermercado, miramos los precios de los productos que nos interesan y elegimos, por norma general, el sitio que más barato nos los ofrece. En las apuestas la intención es la misma. Escoger el bookie que más rentabilidad me va a dar a mi apuesta.

2. Apuesta en contra de la mayoría:
Esta me ha parecido muy interesante. En la propia página de Sportinsights tienen sus propios datos que corroboran esta estrategia e incluso existen artículos cientificos sobre el resultado de apostar a no favoritos en la MLB que también apuntan a que esta estrategia da resultados positivos a largo plazo.

La explicación es simple. Es evidente que a la mayoría nos gusta apostar a ganadores, los bookies lo saben y para distribuir el dinero en una apuesta suelen ofrecer cuotas atractivas a los no favoritos (dogs o under-dogs en inglés). Como ya hemos visto la cuota está relacionada con la probabilidad del suceso, así que, una cuota que ha subido mucho puede llegar a ser un value importante.

Esta es una estrategia complicada de llevar porque normalmente tendremos más fallos que aciertos, pero, teóricamente, los aciertos, al ser a cuotas relativamente altas, deben compensar las pérdidas de los eventos fallados.

3. Porcentajes de Apuestas:
En Sportsinsights ofrecen datos de las cantidades de dinero apostadas en cada uno de los eventos. Esta información sirve para interpretar como se está moviendo el mercado y puede ayudar a seleccionar mejor nuestras apuestas.

4. Apostar a Favoritos al principio y a No favoritos al final:
Este consejo tiene relación con lo que hemos comentado en el segundo punto. Cuando la casa saca las cuotas al mercado, se supone que ha hecho una estimación correcta de las probabilidades de victoria de cada equipo. Sin embargo las cantidades de dinero asociadas a cada una de las apuestas no se suelen comportar conforme a lo que las casas les interesa, con lo que deben mover las cuotas. Así, al cabo de unas horas las cuotas de los favoritos del público habrán bajado y las de los no favoritos habrán subido.

Esto es lo que comentaba en el chat con Inmortal, es probable que alguna vez siguiendo un pick de algun tipster os hayais encotrado que la cuota que tiene el pick no corresponde con la ofrecida por la casa. Casi siempre la cuota habrá bajado. En estos casos, deberíamos 'aparcar' el pick o incluso ir en contra. Con ello probablemente, consigueremos mejores resultados que siguiendo el pick a una cuota más baja. ¿Como es esto posible, si el tipster tiene rentabilidades positivas?. Vamos a intentar explicarlo con un ejemplo:

Supongamos que una casa nos ofrece la posibilidad de apostar en el lanzamiento de una moneda y nos ofrece:

2.1 Para la cara
1.9 Para la cruz

El tipster nos ofrece como pick Cara @2.1, y también será la opción elegida por la mayoría de gente, con lo que las cantidades de dinero apostadas para este resultado serán mucho mayores que para la cruz. La casa de apuestas cuando detecta esta descompensación intenta regular la situación cambiando las cuotas.:

1.9 Cara
2.1 Cruz

El pick Cara @ 2.1 ofrecido al principio por el tipster era 'rentable' (tenía value), pero al cambiar la cuota a 1.9, el pick ha pasado a no tener value. Y lo contrario ha pasado al resultado Cruz, ha pasado de no ser rentable a ser el value de la apuesta.


En la siguiente entrada veremos otra manera de entender el primer punto: buscar siempre la mejor cuota, analizando apuestas 'similares' ofrecidas incluso por la misma casa.

Consejos para principiantes en las apuestas

Ya tenía pensada una entrada referente a consejos útiles para principiantes, pero después de ver los comentarios de Inmortal en el chat, he preparado esta, que está más relacionada con sus preguntas y dejaremos la otra para un poco más adelante.

Una buena forma de empezar en las apuestas es utilizar los picks de tipsters reconocidos y con beneficios demostrables a largo plazo. Esto ya se ha comentado en varios retos del foro de iApuestas, también Alber_Industrial hace algo similar en TodoApuestas. Por regla general esta estrategia suele dar buenos resultados. Pero, si funciona en estos casos ¿por qué suele fallar con los principiantes?. Por tres motivos básicamente:

1. La gestión del bank
2. La falta de disciplina y constancia.
3. Las cuotas

1. La gestión del bank:

Casi puedo asegurar sin riesgo a equivocarme, que el 100% de los principiantes apuestan MAYORES CANTIDADES de las que deberían apostar en cada evento, a esto se le llama OVERBETTING en inglés. Esto es algo muy común, por desgracia, en los nuevos apostantes. Las apuestas se ven como un método de generar grandes ganancias a corto plazo. Primer error. NO HAY QUE PENSAR EN DOBLAR EL BANK EN UNA SEMANA, la meta de la mayoría de tipsters es doblar el bank en UNA TEMPORADA (un año normalmente). La finalidad para ellos son los beneficios estables y continuados a largo plazo.

Una estrategia de grandes beneficios a corto plazo hace que apostemos grandes proporciones de nuestro bank en cada apuesta. Como norma general NUNCA APOSTAR MAS DEL 5% del BANK en NINGUNA APUESTA. Y si queremos ser mas restrictivos no superar nunca el 3%. Así evitaremos que las rachas de malos resultados, que suelen ser normales incluso en tipsters de renombre, nos meta en números rojos al instante. Cuando esto sucede, cosa muy común si nuestro objetivo es el corto plazo, lo normal es abandonar, como ha hecho Inmortal. Este es el segundo error.

2. La falta de disciplina y constancia:

Los números del reto de la MLB allá por finales de Junio eran realmente malos, andábamos con unas pérdidas de 15 unidades y un yield rondando el -7%. En esos momentos lo normal era abandonar, como se suele decir cuando pasa esto en los mercados bursátiles, más vale perder que más perder. Pero debemos recapacitar y plantearnos si nuestra estrategia es buena a largo plazo o no. Si no estamos seguros de la respuesta, lo mejor es abandonar. Si la respuesta es SI, como creía yo en el reto de la MLB, debemos SEGUIR. Las malas rachas, como las buenas, son pasajeras. Como se dice vulgarmente no hay mal que cien años dure... ni cuerpo que lo aguante, contestarán otros. Nosotros nos quedamos con la primera parte del dicho, debemos ser constantes y disciplinados, y si queremos abandonar un reto en el que confiamos, lo abandonaremos con GANANCIAS no cuando estemos en pérdidas. Si hubiesemos abandonado en Junio, nos habríamos quedado con ese -15 en nuestro bank. ¿preferís eso o abandonar ahora con un +10, como tenemos actualmente?. No solo hemos recuperado esas 15 uds perdidas sino que además tenemos 10 uds de beneficio. El cambio es sustancial.

Si vosotros habeis elegido seguir a uno o varios tipsters con buenos números lo que debeis hacer es SEGUIR y REVISAR EL PRIMER PUNTO QUE HEMOS TRATADO. Con casi total seguridad se nos ha ido la mano al colocar los stakes en de nuestras apuestas y esto nos ha llevado a una situación 'comprometida'. Hay que aguantar el chaparrón y esperar tiempos mejores. Pero mientras tanto podemos revisar nuestras apuestas, analizar nuestros errores y aprender de ellos para no volver a cometerlos en el futuro.

3. Las cuotas

Para acabar con estos tres puntos, y no porque sea menos importante, volvemos al tema de las cuotas. Objetivo número 1 para principiantes, BUSCAR LA MEJOR CUOTA POSIBLE. Para ello deberemos abrir cuentas en varias casas y apostar SOLO en aquella que tenga la cuota MAS ALTA. Así de simple y así de fácil. Una estrategia así, puede doblar nuestros beneficios en SOLO 10 PICKS.

Por ahora dejamos estos consejos de principiantes aquí, pero retomaremos el tema en unas semanas.

Manejo de datos en Excel: Ejemplo BetExplorer

En esta tercera entrega de la serie relacionada con el manejo de datos en excel, vamos a hacer un ejemplo de como se puede arreglar la información obtenida de una página web como es BetExplorer.

Partiremos de los datos que ofrece la web, que tienen el siguiente aspecto:


Para llegar a esto otro.


Para ello lo primero que debemos hacer es seleccionar todos los datos, copiarlos y hacer un Pegado Especial > Texto en Excel.

Con esto habremos conseguido la primera parte de la tabla (la zona verde). Ahora nos queda rematar la faena y rellenar usando funciones de excel la zona azul.

Las dos primeras columnas son los nombres de los equipos y los vamos a separar utilizando las funciones IZQUIERDA(Texto; Numero de caracteres), ENCONTRAR(Texto buscado; Texto donde busca; Posicion inicial), y EXTRAE(Texto; Posicion inicial; Numero de Caracteres). Esta es la parte más complicada de la hoja, porque lleva varias funciones de texto anidadas, pero una vez la tienes acabada funciona a la perfección.

Lo más importante para poder separar los equipos es ver si hay algún texto que sirva de separardor entre ambos. En este caso se utiliza el guión "-". Esto nos facilita mucho la tarea, porque lo que haremos es decirle a excel que el primer equipo es el texto que hay antes del guion y el segundo es el que hay después. Vamos a ver como traducimos esto a funciones de excel.

La función ENCONTRAR nos devuelve la posición dentro del texto que ocupa el caracter o caracteres que deseamos buscar. Así = ENCONTRAR(Partido;"-") nos va a devolver la posición en la que se encuentra el guión dentro del Partido.

La función IZQUIERDA nos va a devolver los n primeros carácteres del texto. Con esto lo tenemos casi hecho, lo que queremos es pedirle a Excel que nos devuelva los primeros caracteres hasta el guión. Es decir:

Equipo1 = ESPACIOS(IZQUIERDA(Partido;ENCONTRAR("-";Partido)-1))

La función ESPACIOS la coloco para quitar todos los espacios en blanco que sobren y el -1 de después de ENCONTRAR sirve para eliminar el "-" del texto.

Para el Equipo2 es un poco más complicado, porque cambiando la función IZQUIERDA por DERECHA no nos funciona, debido a que necesitamos saber cuantos caracteres hay empezando por la derecha hasta el guión y la función ENCONTRAR nos dice eso pero empezando por la izquierda. Así que tenemos dos alternativas, utilizar la función derecha y calcular el número de caracteres que necesitamos como la longitud total del texto menos la posición del guión, o bien utilizar la función extrae que nos devuelve un trozo de texto desde la posición que nosotros le digamos. Yo voy a utilizar esta última

Equipo2 = ESPACIOS(EXTRAE(Partido;ENCONTRAR("-";Partido)+1;100))

El +1 que hay después de ENCONTRAR, se usa en este caso para que no nos devuelva el guión junto al nombre del segundo equipo, y el 100 del final es para que extraiga 100 caracteres, como no hay tantos, lo que hace es extraer hasta el final del texto.

Ya tenemos hecho lo más difícil y solo nos queda completar la tabla con las columnas finales.

Los goles marcados por el equipo 1 y el equipo 2 los obteníamos con las funciones HORA() y MINUTO(), como vimos en el anterior artículo. Para obtener el resultado del partido, vamos a usar la función SI(condición; accion si verdadero; accion si falso). Esta función se puede anidar hasta un máximo de 7 veces, y para este caso deberemos anidar dos de ellas. Y nos quedaría algo así:

Res = SI (Eq1>Eq2; 1; SI(Eq1=Eq2; "X"; 2))

Con esta función lo que hacemos es comparar si los goles que ha metido el equipo1 son mayores que los que ha metido el equipo2 y si es así nos devuelve 1, si no es así, miramos si los goles del equipo1 son iguales a los del 2, si es así nos devuelve una X, que como es un texto debemos colocarla entre comillas dobles, y si no es así nos devuelve un 2. Como podeis ver la X la debemos de colocar entre comillas porque es un texto.

Para el cálculo del Over2.5 hacemos algo parecido.

O2.5 = SI (Eq1+Eq2>2;1;0)

Si la suma de los goles es mayor que 2, devuelve 1 y si es menor devuelve 0. El 1 y el 0 lo podríamos cambiar por lo que nosotros quisieramos "OVER" y "UNDER", "O" y "U"... pero yo suelo utilizar 1 y 0 porque para saber el % de overs que han salido solo tengo que hacer la media de esta columna. Si utilizamos cualquier otra nomenclatura el cálculo se complica un poco más.

La columna de O1.5, se calcula prácticamente igual que la de O2.5 y no lo voy a hacer. Lo dejo como deberes ;-)

La columna Par se calcula también usando la función Si y la función Es.Par() de la siguiente manera:

Par = SI (ES.PAR(Eq1+Eq2);1;0)

Con estas funciones ya tendríamos completada nuestra tabla.

La hoja de cálculo completa la he subido a GoogleDocs y la podeis encontrar pinchando en este enlace. El funcionamiento es sencillo, copiais los datos de BetExplorer y los pegais en la hoja con CTRL+V. El resto funciona automático. Espero que os sirva.

Manejo de datos en Excel

Siguiendo con los post relacionados con el manejo de datos en excel, vamos a repasar una serie de funciones avanzadas en Excel que nos van a permitir ajustar a nuestras necesidades, datos copiados desde páginas web.

Las páginas que ofrecen resultados de partidos no suelen seguir un criterio único para mostrar estos datos. Las opciones más comunes son tres: presentar el resultado separado por un guión (1-1), por dos puntos (1:1), o en diferentes columnas (1 1).

El primer paso que debemos dar es copiar los datos y hacer un Pegado Especial > Texto en Excel. Cuando hacemos esto con resultados separados por guiones (1-1), Excel los interpreta como una fecha, siempre que no se presente ninguna incoherencia (días de la supuesta fecha, primer número normalmente, sea menor que 1 o mayor que 31, o cuando los meses sean menor que 1 o mayor que 12). Si Excel advierte una incoherencia en la supuesta fecha, copiará el resultado como una cadena de texto. Para salir de dudas y conocer con que formato ha pegado Excel los datos lo mas apropiado es utilizar la funcion =ESNUMERO(celda). Esta función nos devolvera verdadero o falso segun la celda contenga un valor o no. Hay que tener en cuenta que Excel trata las fechas y las horas como un numero, que representa el numero de días transcurridos desde el 1 de enero de 1990. Así, si el dato que hemos copiado lo ha pegado como una fecha, la funcion nos devolvera verdadero.

Otra manera de detectarlo es viendo la alineación de la celda. Una alineación a la izquierda se usa para cadena de texto y la alineación a la derecha para los números.

Así pues, tenemos 2 opciones, el dato ha sido pegado como fecha o como texto. Si se ha pegado como fecha debemos de utilizar las funciones =DIA(Dato) y MES(Dato). Con la funcion dia obtendremos los goles o puntos anotados por el equipo1 y con la funcion mes los del equipo 2.

Si los datos de partida estan en formato 1:1. Al pegarlos los interpretará como horas, con lo que para separar el marcador utilizaremos las funciones =HORA(Dato) (para obtener los goles del equipo de casa) y =MINUTO(Dato), para el segundo. con este formato segimos teniendo restricciones con respecto a los numeros a pegar y si Excel detecta una incoherencia, hará lo mismo que para el caso de las fechas, pegará los datos como texto.

Para estos casos en que Excel convierte los datos en texto podemos hacer lo siguiente. si los datos siempre tienen el mismo numero de digitos, por ejemplo resultados de futbol el 99% de las vecs los goles seran un solo digito, goles de balonmano 2 digitos (en partido completo). se pueden usar las funciones =DERECHA(Texto; Numero de Caracteres) e =IZQUIERDA(Texto; Numero de Caracteres) combinadas co las funciones =ESPACIOS(Texto) y =VALOR(Texto). las funciones izquierda y derecha son similares y lo que hacen es devolver una cantidad especifica de caracteres empezando por la izquierda o por la derecha del texto selecionado. Estas funciones siempre nos devuelven un texto, que convertiremos en numero con la funcion valor.

La función espacios es muy importante, ya que elimina del texto todos los espacios excepto los que hay entre palabras. nos servira para eliminar espacios sobrantes al comienzo y al final del texto.

El resultado final de todo esto seria algo asi (los datos son de BetExplorer.com)


En la siguiente entada veremos como podemos arreglar nuestros datos cuando tenemos entre los valores pegados textos y numeros, y como se pueden obtener automaticamente los nombres de los equipos.

Resumenes gráficos de variables en escala ordinal

Los gráficos utilizados en el resumen de datos para variables en escala ordinal son los mismos que para el caso de variables en escala nominal, es decir, histogramas o gráficos de barras y diagramas de sectores. La única diferencia la encontramos en la interpretación del histograma. En los gráficos de escala nominal, la posición de cada una de las categorías era indiferente, mientras que en este caso la posición nos informa sobre el orden en el que se encuentran las categorías.

Veamos un ejemplo. Utilizamos los mismos datos que en la entrada anterior de representaciones gráficas:

Este gráfico

Es exactamente el mismo que este otro:

Lo único que hemos hecho es reordenar las categorías. Sin embargo con datos en escala ordinal, la forma del gráfico si que es importante, ya que las categorías SI estan ordenadas.

Ejemplo posición en parrilla de salida de Alonso y Piquet

Aquí se puede ver que las barras naranja (Alonso) se encuentran agrupadas más a la izquierda (puestos mejores en parrilla) que las barras azules (Piquet).

El objetivo de esta representación gráfica es simplemente mostrar diferencias en las distribuciones. Podemos encontrar diferentes formas de distribuciones a simple vista, pero para confirmar estas diferencias habría que hacer uso de los test de hipótesis, que supongo veremos en posteriores entradas.

Lo único que haremos por ahora es estimar probabilidades y comprobar que se ajustan a las cuotas ofertadas por las casas. Así, recuerdo un pick que puse en Forobet al comienzo de la temporada de F1 sobre un H2H entre Alonso y Piquet. La cuota estaba en torno al 1,15 para la clasificación y a mi me parecía un regalo. Era una 'chiquicuota', como se le suele llamar, pero para mi, esta cuota no debería haber pasado de 1,01 o 1,02. Y los datos al final de la temporada así lo han demostrado. Nelsiño no ha ganado ningún H2H en clasificación a Fernando. Si la cuota hubiese sido correcta, supondría una probabilidad de 1/1,5*Fracción de pago (suponemos un 85%) = 74%

Multiplicando este 74% por el total de carreras (18) supondría un 13-5 a favor de Alonso, cuando ha sido un 18-0. Después de hacer un simple test de hipótesis con estos datos, podemos decir que hay evidencias estadísticas que demuestran que la cuota colocada no era correcta. Es decir, habiamos encontrado un autentico value. Con lo que la apuesta estaba más que justificada.

La distribución de Poisson: Test de ajuste

En esta segunda entrega sobre el uso de la distribución de Poisson para predecir resultados de partidos de Futbol vamos a exponer como podemos comprobar si nuestros datos se ajustan a este tipo de distribución o no. Esto se conoce en estadística como test de bondad de ajuste o, en inglés, goodness of fit test.

Este proceso que vamos a explicar se puede utilizar con cualquier tipo de variable en escala nominal u ordinal y sirve para cualquier tipo de distribución.

El test está basado en la distribución chi cuadrado () y fue creado por uno de los más reputados estadísticos de los últimos tiempos, Karl Pearson. Su base, como en todos los test de hipótesis, consiste en establecer dos hipótesis, la hipótesis nula que considera que los datos que tenemos se ajustan a una determinada distribución y la hipótesis alternativa que es la negación de la nula, es decir, nuestros datos no se ajustan a la distribución. Dicho así no parece muy claro, pero es como se suele explicar la teoría. Traducido al cristiano sería algo así: Tenemos unos datos que 'parece' que siguen una determinada distribución, pero hay unas diferencias entre los datos que tenemos (observados) y los que deberían de ser (esperados). ¿Son esas diferencias lo suficientemente grandes para que sean provocadas por el azar?. La respuesta a esta pregunta la obtendremos con el test de bondad de ajuste.

Alguno a estas alturas se estará preguntando, ¿pero para que necesito hacer esto, si saco la media y lo meto en la fórmula de Poisson y obtengo el resultado que necesito?. La respuesta es sencilla, si nuestros datos no siguen la distribución de Poisson, todas las predicciones que hagamos utilizando las fórmulas para esta distribución serán erroneos y si nos basamos en ellos para apostar, tenemos muchas posibilidades de ver numeros rojos en nuestro bank a final de temporada.

Después de este pequeño paréntesis económico, vamos a ver como podemos realizar el test de bondad de ajuste a una distribución de Poisson en Excel.

Para ello tomaremos los datos del total de goles marcados por partido en la primera división durante la temporada 2007-2008. Pulsando sobre estadísticas tendremos el resumen de los datos que necesitamos. Estos serían nuestros valores 'Observados'. El siguiente paso que debemos hacer es calcular la media de los goles totales marcados por partido. Al tener los datos resumidos no podemos utilizar la función promedio() si no que debemos hacer una especie de 'desagrupamiento'. Esto, como siempre, se puede hacer de varias formas, yo voy a explicar dos de ellas, las más sencillas.

La primera es crear una nueva columna en la que multiplicaremos el número de goles por la cantidad de partidos (Columna C). Sumaremos todos esos productos y dividiremos este valor por el total de partidos jugados.

La otra es usar la formula sumaproducto(A2:A11;B2:B11) y nos ahorramos el paso de las multiplicaciones, que lo hace excel internamente. El resultado es el mismo para ambos casos, ¡Faltaria más!.

Una vez calculada la media, lo que hacemos es determinar los valores 'Esperados' según una distribución de Poisson con esa media. Esto lo calculamos multiplicando la probabilidad de Poisson para cada resultado, por el total de partidos.

La última columna la utilizaremos para calcular el estádistico con la siguiente fórmula:



Esta columna es importante, porque nos da información de donde se producen las mayores discrepancias. Cuanto mayor sea el valor que obtengamos, mayor es la discrepancia entre el valor observado y el esperado. Más alejado está ese punto de su lugar teórico predicho por la curva de Poisson y más probabilidad tenemos de que el resultado del test nos diga que nuestros datos no se ajustan bien a la curva.

Ya solo nos queda sumar todos estos valores y 'buscar' dentro de la función y comprobar si las diferencias que hemos encontrado son lo suficientemente grandes o no para rechazar o no rechazar la hipótesis nula. Ya veis que he dicho rechazar o no rechazar, en lugar de rechazar o aceptar, porque NUNCA se acepta la hipótesis nula. Este es un error muy común en la interpretación de los resultados de test de este tipo. Pero dejaremos esto para un futuro.

La función tiene dos parámetros, el primero de ellos es el valor de nuestra suma, y el segundo son los grados de libertad para los que vamos a calcular este estadístico.

Los grados de libertad se obtienen con la siguiente fórmula: GL = Nc - Np - 1

Siendo Nc = al número de categorías que tenemos y Np = número de parámetros que estamos estimando. Para nuestro caso tenemos 10 categorías y vamos a estimar un parámetro solo que es la media: GL = 10 - 1 - 1 = 8

El valor que nos devuelve es lo que en estadística se llama P-Value, y corresponde a la probabilidad de equivocarnos si rechazamos la hipótesis nula. Como norma general se suele tomar como valores de corte el 5% ó el 1% dependiendo de lo restrictivos que seamos. Este valor lo debemos de tomar ANTES de la realización del test y será nuestro límite para rechazar o no rechazar la hipótesis nula.

En el ejemplo tenemos un P-Value de 0.54 con lo que debemos decir que las diferencias que hemos encontrados no son lo suficientemente grandes como para decir que nuestros datos no siguen una distribución de Poisson. Como esto es un poco engorroso, hay mucha gente, que viendo este P-Value, adopta una postura más comprometida y llega a decir que nuestros datos siguen una distribución de Poisson. Pero como ya he explicado esto no es del todo cierto, puede que siga una distribución de Poisson o puede que se acerquen más a otro tipo de distribución. El aspecto final de la hoja sería el siguiente:



Como no quiero extenderme más, solo hago una puntualización final. Si os fijais tenemos dos categorías con menos de 5 datos (8 y 9 goles), siendo estrictos deberíamos haber agrupado estas dos categorías y crear una nueva como más de 6 goles, agrupando en ella las categorias 7, 8 y 9 goles. El resultado del test varía poco en este caso, así que para no complicar más la explicación lo he dejado así. Si alguno está interesado en como se haría el test en este caso que lo diga y lo explicaremos.

Un saludo y hasta la próxima

EDITO 22/07/10: Al final he encontrado una forma de añadir hojas de cálculo al blog y he creado una mini hoja Excel para calcular los resultados de un partido de Futbol a partir de la media de goles marcados por cada equipo. La hoja la teneís aqui.

Resumenes gráficos de variables en escala nominal

Las dos formas más frecuentes de resumir gráficamente variables de escala nominal son los diagramas de barras y los diagramas de sectores. Lo que se representa en ambos casos es la cantidad de eventos que se han dado en cada una de las categorías. Es importante señalar, que el orden en el que se presentan las categorías no tiene ningún significado.

En apuestas deportivas no es fácil encontrar casas que nos ofrezcan apuestas relacionados con variables en escala nominal. Uno de los pocos ejemplos que podemos encontrar son apuestas al primer evento que se puede producir en un partido de futbol. Bwin es una de las pocas casa en las que se pueden encontrar apuestas de este tipo y hace un par de semanas ofrecían lo siguiente para el partido entre el Cluj y el Chelsea (lo he seleccionado en honor a mi compañero Baldani que es un apasionado de la liga Rumana):

Primer evento en la primera parte

1. Tarjeta @ 1.7
2. Gol @2.65
3. Sustitución @15
4. Medio tiempo @8.5

Este es un claro ejemplo de variables en escala nominal. Se ofrecen 4 categorías diferentes con sus cuotas entre las cuales no existe ningún tipo de relación de orden, entendiendo por orden, el que una categoría sea mayor a otra. Evidentemente no se puede decir que tarjeta sea mayor que sustitución o que gol sea menor que medio tiempo.

Para realizar nuestro resumen utilizaremos los datos que ofrecía la propia Bwin. Allí podíamos encontrar los resultados de los dos equipos en sus seis ultimos encuentros y además entrando en cada uno de los partidos podíamos ver los detalles del mismo. Esta será nuestra fuente de datos para este ejemplo.

Iremos partido por partido apuntando el primer evento hasta obtener una columna con 12 datos (6 datos por cada equipo)

Una vez tenemos esto, el siguiente paso es construir un histograma y esto se puede hacer de varias formas en Excel. La que más utilizo, porque creo que es la más rápida y flexible es la tabla dinámica, aunque también se pueden usar otras como los subtotales, la función histograma implementada en el complemento de análisis de datos, la función de excel frecuencia() o la más simple contar.si(). Es esta última la que vamos a explicar en este ejemplo.

El resultado final que vamos a obtener es una hoja como esta:

En la que en la columna D tenemos los datos de los partidos, que hemos ido sacando de Bwin y en las columnas H-I-J-K tenemos los resultados.

Así, partiendo de la tabla de datos, vamos a crear la siguiente:

En la primera columna colocaremos los cuatro tipos de eventos. IMPORTANTE, la función contar.si() no distingue entre mayúsculas y minúsculas, pero si es sensible a los espacios entre palabras o al final de las mismas. Así que, lo que recomiendo, es copiar y pegar los identificadores de cada una de las categorías para no equivocarnos al teclear.

En el resto de la tabla introduciremos la siguientes fórmulas. Los $ supongo que sabeís para que sirven, y se colocan SOLO EN WINDOWS pulsando [F4] repetidas veces, para fijar la celda, la columna o la fila. Volveremos sobre esto en otras entradas.


La columna de frecuencias la obtendremos con la función contar.si() de Excel, que tiene dos argumentos. El primero es el rango donde se encuentran nuestros datos, y el segundo es el criterio, lo que queremos que Excel cuente. Para nuestro ejemplo el rango de datos siempre es el mismo y lo fijamos con los símbolos de $ para que no varíe al arrastrar la función y el segundo es el nombre de la categoría. Con esto conseguiremos que Excel nos cuente la cantidad de veces que aparece el nombre de la categoría en el rango de datos que le hemos dado. A esto habitualmente se le llama frecuencia.

En la siguiente columna hemos calculado un cociente entre la frecuencia de cada categoría y el total de elementos que tenemos. Esto representa la cantidad de elementos que tenemos de cada categoría con respecto al total. A esto se le llama frecuencia relativa y se suele representar en porcentajes, porque también coincide con la probabilidad de que se de un resultado de esa categoría.

Y con esto tenemos ya nuestro resumen gráfico en forma de histograma


Que podríamos representar también en diagrama de sectores:


Como podeis ver en este caso los % coinciden con las frecuencias relativas que hemos calculado en la tabla.

El último paso que nos quedaría sería el de utilizar estos datos para evaluar las cuotas que nos ofrecía Bwin. Si considerasemos como representativos estos seis partidos de cada equipo para evaluar el partido en cuestión, las cuotas que Bwin debería haber ofrecido serían las mostradas en la última columna de la tabla. Para su cálculo simplemente divdiremos 1 por la frecuencia relativa. Comparando estas cuotas teóricas con las ofrecidas por Bwin vemos que existe una discrepancia en la de Sustitución, que Bwin la ofrecía a 15, mientras que en nuestro cálculo habíamos obtenido 6. Esta sería para nosotros una apuesta de valor (value bet) y sería la que deberíamos elegir.

Antes de acabar puntualicemos varias cosas, por si las moscas.

1. Los datos de partida son inventados, pero las cuotas eran las reales
2. No es muy conveniente utilizar solo 6 partidos como un estimador razonable. Cuando se usan tablas de contingencia se habla de que hay que tener como mínimo 5 datos por cada casilla. En nuestro caso sería conveniente tener al menos 5 datos para cada una de las categorías, lo que solo se cumple para una de ellas.
3. Es muy probable que la value bet que obtengamos no sea la que tiene una probabilidad más alta de salir, lo que quiere decir que es probable que no salga. Pero, pero, pero, si seguimos utilizando este método y nuestros análisis son correctos, la frecuencia con la que se irán dando los aciertos hará que se compensen las pérdidas a largo plazo.

Creo que ha sido un pequeño ladrillo para comenzar la semana. Espero que no se haya dormido nadie. Hasta otra