Mostrando entradas con la etiqueta Datos. Mostrar todas las entradas
Mostrando entradas con la etiqueta Datos. Mostrar todas las entradas

Estudiar el pasado puede definir el futuro - Parte 2

7 días después estamos de vuelta para completar el post que inicié el fin de semana pasado. Como recordáis tomamos los datos de la web European Centre for Disease Prevention and Control para hacer las predicciones y los gráficos que os muestro en estas dos entradas.

La pregunta que lanzábamos hace una semana era, ¿Se puede predecir el comportamiento de la evolución de casos en los distintos países?. Vosotros mismos la vais a poder responder si continuáis leyendo. La zona sombreada en amarillo son los datos nuevos de esta semana.

  • Italia

A Italia la dejamos en su día 27 y su gráfica merece un optimismo moderado, se ha ido despegando de la curva ajustada y da señales de una bajada en la cantidad de contagios, lo que es una buena señal.

  • ALEMANIA

A Alemania la dejamos en su día 22 y la evolución es positiva, como en Italia, su gráfica en azul (casos reales) se va alejando de la curva de ajuste. Buena señal también.

  • CHINA

China llevaba mucha ventaja al resto de países en la gráfica, y como podéis ver sus casos reales se han estabilizado por completo. Todas sus acciones han dado resultado y se puede decir que la pandemia en este país está bajo control.

Y ahora vamos con nuestros campeones

  • ESTADOS UNIDOS
Su maravilloso presidente, pasó olimpicamente de aprender de lo que estaba sucediendo en otros países y no tomó ninguna medida. Hace una semana dijimos que en 7 días superarían los 100.000 infectados, y en siete días se plantaron en 104.000, hoy van por los 124.000 y subiendo religiosamente pegados a su curva de predicción, aunque, hay que decirlo, por debajo de ella. Dentro de lo malo lo menos malo.

  • ESPAÑA

 Y por último ¿que ha hecho España?, pues salirse, como una campeona!!
Como nuestros compañeros los yankis seguimos nuestra peregrinación por la curva de predicción, pero, no conformándonos con eso, la mejoramos!!!. Y nuestros gobernantes diciendo que ya se ven indicios de mejora en alguna comunidad. Es increíble. El hormigón armado que se gastan nuestros y políticos en su rostro, para sí lo querrían muchas de las constructoras que estos días van a tener que dejar a toda su plantilla en casa.

Si vamos a las previsiones hechas hace una semana este es el resultado:

Dia Pred Real Error Porc (%)
Domingo 24160 24892 732,0 3,0%
Lunes 28630 28538 -92,0 -0,3%
Martes 33680 33055 -625,0 -1,9%
Miércoles 39370 39639 269,0 0,7%
Jueves 45730 47576 1846,0 4,0%
Viernes 52824 56154 3330,0 6,3%
Sábado 60700 64025 3325,0 5,5%

Hasta el pasado miércoles íbamos copiando la curva casi al pie de la letra, pero los tres últimos días hemos despegado. Yo lo dejo aquí porque se me puede ir la tecla y soltar algún improperio.

Señores.... disfruten lo votado.

Estudiar el pasado puede definir el futuro - Confucio

Hace tiempo que tengo el blog abandonado por razones varias, pero el momento actual creo que bien merece una entrada nueva. Estamos viviendo una situación excepcional, que nos marcará y recordaremos durante toda nuestra vida y me duele en el alma que ver como se colapsan hospitales, como se incrementa día tras día el número de victimas ante la pasividad o lentitud en la toma de decisiones.

En esta entrada no voy a hablar de apuestas deportivas, obviamente no estamos en el tiempo ni el lugar para ello, lo que voy a plantear es la necesidad de estudiar y aprender, de analizar datos, de hacerse preguntas y de buscar soluciones.

Todos los datos que he utilizado los podéis encontrar en la web del European Centre for Disease Prevention and Control, desde donde se puede descargar un fichero Excel con toda la información sobre casos detectados y fallecidos por la pandemia del COVID-19.

No me enrollo mas y comenzamos. Como muchos de vosotros ya sabréis este virus es especialmente peligroso por la tasa de contagio que tiene. La OMS estima que esta tasa de contagio (R0) oscila entre 2 y 3, lo que significa que cada persona contagiada con el virus puede a su vez contagiar a 2 ó 3 personas más. Para que nos hagamos una idea, la gripe, por ejemplo, tiene una tasa de 1.5.

Esta tasa de contagio no es fácil de calcular pero, vamos a intentar estimarla con los datos facilitados por el ECDC para varios países, en concreto, China, Italia, Alemania, España y Estados Unidos.

El día 1 en los gráficos corresponde al primer día en el que los casos acumulados superan los 20 contagiados.

Empezamos con nuestros vecinos Europeos.
  •  ITALIA:

La gráfica azul representa los datos reales mientras que la naranja son los datos ajustados a una función exponencial cuya expresión es:


Donde x es el numero de días transcurridos, c es una constante para ajustar el punto inicial de la curva y b es lo que podríamos llamar el ratio de contagios. El ajuste de la curva como podéis ver es prácticamente perfecto (lo he hecho en Excel usando el Solver, por no alargar el post no pongo aquí todo el desarrollo).

Para Italia estas tres variables toman los siguientes valores:
c=1495.73 a=0.19 y b=3.76
  • ALEMANIA

El ajuste en este caso no es tan bueno, pero vemos que también sigue una curva exponencial cuyos parámetros son: c=0 a=0.0031 y b=5.02
Lo más llamativo de este caso es que el valor del ratio de trasnsmision ha subido a 5.02 que hará que el ascenso de los casos será mucho más acentuado.

Y en ESPAÑA, ¿COMO ESTAMOS?

  • ESPAÑA
Pues tenemos un ajuste prácticamente perfecto, y nuestros parámetros son:
c=28.88 a=0.18 y b=3.82
Estos datos son practicamente CALCADOS a los de Italia, aunque nosotros estamos en el dia 21, mientras que ellos están en el 28. ¿que quiere decir esto? pues que SI NO HACEMOS NADA MAS, las previsiones para los próximos dias son (hoy estamos a Domingo 22 de Marzo de 2020): Domingo 24160, Lunes 28630, Martes 33680, Miércoles 39370, Jueves 45730, Viernes 52824, Sábado 60700

Espero equivocarme, pero, como dicen en el anuncio... yo ahí lo dejo.

Nos quedan ver dos paises importantes.

  • ESTADOS UNIDOS

Otro ajuste impecable, pero este MUCHO MAS PELIGROSO, ya que sus parámetros son: c=0 a=0.0003 y b=6.03. 
La falta total de coordinación y medidas contra el virus va a hacer que su crecimiento sea mucho más acentuado que en Europa, y el modelo predice que dentro de 7 días el número de infectados superará los 100.000


  • CHINA
El modelo predice prácticamente sin fallos desde el dia 1 al 22 (mas o menos donde estamos nosotros ahora) con parámetros c=0 a=3.42 y b=3.00 muy parecidos a los de Italia y España. Pero a partir del dia 22 la cosa cambia.

La gráfica empieza a desviarse de la predicción y sobre el dia 30 comienza a aplanarse. SEÑORES DEL GOBIERNO, hagan el favor de averiguar que hizo CHINA en esos días previos y COPIEMOS la estrategia para parar este terrible goteo diario de muertes.

Este POST tendrá otro de continuación dentro de una semana, cualquier comentario es bienvenido. Hasta entonces, cuidaos mucho y espero volveros a ver a todos dentro de 7 días.

Pitágoras y la MLB

Este filósofo, pensador y matemático griego da nombre a uno de los teoremas más conocidos de las matemáticas: El Teorema de Pitágoras, aunque, paradójicamente, no se le puede atribuir ni él ni tampoco a su escuela su descubrimiento. En civilizaciones mucho más antiguas como la babilónica, la hindú o la egipcia, ya eran conocidas las llamadas ternas pitagóricas: tríos de números que cumplen con este teorema.

Una de las más famosas, la terna 3-4-5, era denominada por los egipcios 'el triángulo sagrado' y la pirámide de Kefrén, por ejemplo, fue construida basándose en ella. Su lado mide 412 Codos y su altura estimada en la época de su construcción era 275 Codos. La relación entre la semi-base de la pirámide (412 / 2 = 206) y la altura 275 es de 3/4 (206 / 275 = aprox 0.75 = 3/4).

Por increíble que parezca, también tenemos referencias a esta fórmula en el mundo de las apuestas. Un estudioso de la MLB llamado Bill James, descubrió hace unos 30 años, que había una relación entre las carreras concedidas y anotadas por los equipos de la MLB y su porcentaje de victorias. Esta relación la expresó como:


Debido a la similitud de esta fórmula con el teorema de Pitágoras, en el que todos sus valores también aparecen elevados al cuadrado, la denominó el teorema de Pitágoras para el beisbol.

A partir de aquí otros muchos investigadores han intentado aplicar el mismo concepto de fórmula para otros deportes y así se ha llegado a la misma fórmula en la que los doses se sustituyen por los siguientes factores:

NFL: 2.37

NCAA Basketball:10

NBA: 14


La finalidad de esta fórmula es predecir cual sería el porcentaje teórico de partidos ganados en función de los puntos anotados y recibidos. Esto puede ser de gran interés para el apostante. Este valor teórico se puede comparar con el real y en consecuencia se pueden determinar equipos que sus valores reales están 'desajustados' frente a las predicciones. Si la realidad refleja un valor inferior al teórico se supone que ese equipo debe mejorar en un futuro y el % de victorias debe ser superior al que ha obtenido hasta ese momento, por el contrario si el valor real es superior al teórico, tenemos a un equipo 'sobrevalorado' y sus resultados deberían ser peores en un futuro.

En la temporada 2006-07 los Miami Heats tenían una media por partido de 94.6 puntos anotados frente a 95.5 recibidos. Su porcentaje de victorias esperadas era del 47% frente al 54% (44-38) que llevaban durante la temporada. En los play-offs cayeron estrepitosamente 4-0 frente a Chicago.

Algo similar le sucedió a los Dallas Mavericks, que comenzaron los playoffs con un 74% teórico frente a un 82% real. También fueron eliminados en la primera ronda de los playoffs.
San Antonio Spurs se presentaban a los playoffs con un panorama radicalmente diferente: un 71% de victorias reales frente a las 78% esperadas. Los números parecían indicar que los Spurs, no lo iban a hacer mal en los playoffs, y así fue, resultaron los ganadores de ese año y en los play offs consiguieron un registro de 16 partidos ganados frente a 4 perdidos (80%).

Otros ejemplos como estos se pueden encontrar analizando otras ligas y otras temporadas, y la idea sigue siendo la misma, estimar un nuevo parámetro que nos permita añadir un factor más al análisis de nuestros picks. Ahora es responsabilidad de cada uno ajustar su peso en la decisión final. Tanto si es alto como si es bajo, confío que os sea útil de alguna manera.

Predicciones MLB 14 Mayo 2010


A partir de mañana las predicciones las iré colocando en el blog de los retos, aunque no contabilizaré los resultados.

Volvemos con la MLB

Se nota que ya ha comenzado la liga de béisbol porque cada vez son más las visitas que llegan al blog buscando datos y estadísticas de la MLB. Como ya sabrán los más antiguos del lugar, llevo ya unos años con los retos de la MLB y el año pasado, tras unos comienzos no demasiado esperanzadores, tuvimos un final de temporada expectacular, con unos números y porcentajes de acierto realmente altos.

Por ahora estoy actualizando datos en el sistema, y esperando a que las estadísticas de los pitchers se estabilicen, así que para ir abriendo boca y mientras nuestro sistema empieza a funcionar, voy a colocar predicciones de resultados y ratings de otras conocidas y prestigiosas webs, como: VITIBET, MASSEY RATINGS Y THE PREDICTION TRACKER.

Cada una de ellas coloca sus predicciones a 'su manera' así que lo que vamos a hacer es juntarlas todas en una misma tabla para que sea más sencilla su comparación.

Espero poder tener tiempo suficiente para ir colocándolas a diario, pero no me enrollo más y comenzamos:

PREDICCIONES MLB 13 MAYO 2010:


Pulsar sobre la tabla para verla a mayor tamaño.

En la parte de la izquierda de la tabla (zona con lineas color rojo) tenemos los datos de los equipos, EQ2 es el equipo que juega fuera y EQ1 el que lo hace en casa. En la zona azul tenemos las predicciones (EQ2 = anotación prevista para el equipo de fuera, EQ1 = anotación prevista para el equipo de casa) y los ratings (R), cuanto más positivo o negativo es el rating, más confianza en la victoria del equipo de casa/fuera.

Representaciones gráficas de variables continuas

Seguimos con la estadística que la tenía un poco abandonada y volvemos con la representaciones gráficas de variables cuantitativas continuas. Para la representación gráfica estas variables podemos elegir una gran cantidad de gráficos. Los más útiles son los diagramas de distribución de frecuencias, frecuencias absolutas o relativas y acumulados o no, los diagramas de tallo y hoja (Steam and leaft plot en inglés) y los diagramas de caja y arbotante (box and whiskers plot). Como estos últimos tienen bastante que ver con el cálculo de valores medios y dispersión de los datos los dejaremos para cuando tratemos estos apartados en un futuro.

En esta primera entrada vamos a tratar exclusivamente de las distribuciones de frecuencia y como podemos realizarlas en Excel. Para ello vamos a utilizar el número de goles anotados por minuto en la primera parte de los partidos de primera división como ejemplo de aplicación. Los datos no son reales, pero para el que quiera y tenga tiempo en Betexplorer podeis encontrar toda la info, eso sí, hay que ir partido a partido.

Bueno supongamos que hemos hecho eso, hemos ido partido a partido copiando y pegando todos los datos de Betexplorer en Excel y al final tenemos algo así:


En la primera columna tenemos los minutos en los que se han marcado los goles y en la segunda tenemos el jugador que ha marcado.

Lo siguiente que debemos hacer es 'agrupar' los datos, pero antes tenemos que determinar el número de grupos o clases que vamos a hacer. Este es un paso realmente importante ya que si los grupos se hacen muy grandes, tendremos pocos grupos y muchos datos en cada grupo, se perderá información sobre la estructura de datos y si se hacen muy pequeños, muchos grupos y pocos datos por grupo, es difícil distinguir la tendencia de la distribución. Existen varias reglas para establecer el número de intervalos/grupos, la más extendida es la de hacer el número de grupos igual a la raiz cuadrada de la cantidad de datos disponibles. Otra regla que podemos también podemos utilizar es la regla de Sturges

Para nuestro ejemplo vamos a usar esta última, porque nos da una cantidad de grupos un poco menor que si utilizamos la de la raiz cuadrada. Para 350 datos que tenemos el número de grupos será N = 1 + 3.3 x log(350) = 9.39, aprox 9 grupos. Estos grupos es conveniente que sean de igual tamaño y mutuamente excluyentes, es decir, si tenemos registrados goles desde el minuto 0 al 45 deberemos tomar grupos de 45 / 9 = 5 Minutos. Y deberían ser 0-4, 5-9 ... Así, ningún intervalo es mayor que otro y no existen grupos que incluyan dos minutos iguales.

Ahora debemos calcular nuestra tabla de frecuencias en Excel. Y esto, como la mayoría de cosas en excel, se puede hacer de varias formas:

1. Usando la función frecuencia
2. Usando la función histograma que se encuentra dentro del complemento 'análisis de datos'
3. Usando tablas dinámicas
4. Usando subtotales
5. Usando la función contar.si

Yo voy a usar esta última, porque es la menos utilizada habitualmente en estos casos y además nos servirá para explicar una función de excel realmente potente, pero ya digo que cualquiera de las otras nos podría valer.

El resultado final es el siguiente.


En la primera columna tenemos los mintos empezando en el 0 y acabando en el 50. OJO esto es importante para el cálculo, no debemos acabar en el minuto 45 aunque en nuestros datos este sea el valor máximo. Veremos el por qué al analizar la fórmula de la columna Frecuencia Acumulada. Para el cálculo de la frecuencia acumulada usamos la función contar.si, que tiene dos parámetros. El primero es el rango de datos, en nuestro caso los datos están en el rango A1:A350. El segundo parámetro es el criterio para contar. Para la primera fila debemos contar todos las veces que aparecen números entre 0 y 4, es decir, número de minuto menor que 5. Esto lo podría haber hecho así directamente =contar.si(A1:A350;"<5"). Si utilizamos esta función obtendremos el mismo resultado, pero, en primer lugar, es más lento de programar, ya que debo ir cambiando el criterio para cada fila de mi tabla y en segundo lugar es mucho menos flexible. De la manera que lo hemos hecho cambiando el valor de las celdas de la columna E nos va a cambiar el criterio y nos acutalizará los datos automáticamente. Además la tabla la rellenamos mucho más rápidamente copiando la fórmula a toda la columna. El valor del minuto 50 lo necesitamos ya que el calculo del último intervalo excluye (el menor es estricto, no es menor o igual) al minuto 45 y muchos de los goles que tenemos contabilizados se han marcado en ese minuto, que incluye también los goles marcados en tiempo añadido.

La última columna es la frecuencia sin acumular y su cálculo es sencillo, como se muestra en la imagen. Con esto tenemos acabada nuestra tabla de frecuencias y podemos representar gráficamente los datos. El resultado final es el siguiente


Para el cálculo de las frecuencias relativas debemos dividir cada uno de los valores de nuestra tabla por el total de datos, en nuestro caso 350. Y las graficas que se obtienen son exactamente iguales lo único que nos cambiaría es la escala del eje Y, que pasaría a ser de 0 a 100%.

Bueno, lo dejamos aquí por hoy y si teneis alguna duda o quereís alguna aclaración ya sabeis como contactar conmigo. Un saludo.

F1: Gp Gran Bretaña 2009

El GP de Inglaterra de este año vendrá marcado por dos acontecimientos históricos, el primero de ellos es la ruptura entre la FIA y la FOTA que parece que llevará a un mundial de F1 paralelo si las cosas no se enmiendan y el segundo el final de una era en el circuito de Silverstone.

Silverstone es una circuito rápido y complejo a la vez, con una serie de curvas enlazadas de alta velocidad y una zona lenta y técnica. La aerodinamica resulta crucial y hay que dar con el reglaje correcto para que los tiempos salgan.

A ello se une la climatología, tanto la lluvia como el viento son factores muy a tener en cuenta. La lluvia debido al clima muy cambiante de Inglaterra puede hacer acto de presencia en cualquier momento y la situación del ciruito en un antiguo aeródromo hace que el trazado sea muy plano y el viento sople con fuerza en algunas ocasiones.

Vamos con las estadísticas:

ESTADISTICAS DE CARRERAS:

Entre los pilotos con más carreras disputadas en este circuito los que destacan por sus buenos resultados son Rubens, Fisi y Kimi, este último con más del 88% de las veces entre el top 8. En el lado opuesto tenemos a Trulli y a Webber.

ENTRENAMIENTOS Y VUELTAS RAPIDAS:

En este apartado siguen siendo Kimi y Rubens los dos mejores colocados, Kimi con más vueltas rápidas que poles.

CIRCUITO:


El circuito no es demasiado exigente con los monoplazas y eso se nota en el alto porcentaje de coches que acaban la carrera. Si nos fijamos solo hay 2 años en los que acabaron menos del 70% de los coches, 2002 y 2008, ambos años coinciden en que la carrera se disputó en lluvia o con el circuito mojado. Nos fijaremos bien en la previsión meteorológica para ver si se puede sacar partido de esta circunstancia.

Predicciones MLB: Miercoles 10 Junio 2009


F1: GP de Monaco 2009

Llegamos al gran premio por excelencia de la temporada. La carrera de este fin de semana en Montecarlo es la carrera más especial de la temporada, un circuito urbano realmente complicado y estrecho, con curvas muy lentas, en el que los adelantamientos son casi imposibles, por lo que la calificación determinará prácticamente el resultado final de la carrera.

Otra de las particularidades de este Gran Premio es que los primeros libres se disputan los jueves, y los viernes no hay entrenamientos. En las dos primeras sesiones libres de hoy los pilotos se han dedicado a ajustar las suspensiones y la carga aerodinámica del monoplaza. Aunque parezca una incoherencia, Monaco requiere los niveles de apoyo aerodinámico más altos de toda la temporada. Al contrario de lo que pueda parecer el mayor beneficio de la carga aerodinamica en este circuito no son en las curvas, que son la mayoría de baja velocidad, sino que se aprovecha en las frenadas y aceleraciones.

Veamos los resultados de los pilotos en pasadas temporadas:

ESTADISTICAS DE CARRERAS:



De los pilotos que más carreras han disputado en este circuito, el más consistente en cuanto a resultados es Rubens Barrichelo, que ha acabado cerca del 90% de las veces entre los 8 primeros, mientras que Kimi, por ejemplo, solo lo ha hecho el 38% de las veces. Este año, creo que puede ser el año en que Barrichelo suba a lo alto del podium en Montecarlo.

Otro dato interesante es el de Heidfeld, y lo veremos cuando analicemos los datos de las clasificaciones:


ENTRENAMIENTOS Y VUELTAS RAPIDAS:

Como vimos en las carreras, Heidfeld ha acabado el 67% de las veces entre los 8 primeros, mientras que en entrenamientos lo ha hecho bastante peor. Sólo en dos ocasiones ha acabado entre los diez primeros. Así que habrá que estar atentos a las cuotas de si entra en la Q3 y si entra en los puntos en la carrera porque las cuotas deberían ser muy diferentes.

En este circuito deberían estar arriba en calificación, Trulli, Alonso, Hamilton e incluso Raikonen, según los resultados de las pasadas temporadas. De todos ellos el que parece tener el mejor coche es Trulli, así que sería una buena opción para la pole del sábado.

En cuanto a las vueltas rápidas, el que mejores resultados ha obtenido es Kimi.

Todo esto hay que matizarlo este año, debido al gran rendimiento que están teniendo tanto Brawn (Button) como Red Bull (Vetel) en los entrenos. Entre todos ellos estará el poleman y la vuelta rápida en carrera.


CIRCUITO:

Como ya hemos dicho este es un circuito complicado, tanto para pilotos como para las máquinas. En estos últimos años parece que ha aumentado el número de coches que finalizan la carrera, pero aún así, sólo una vez se ha superado el 80% de los coches (16 coches este año). Yo creo que estarán rondando los 6-7 abandonos en la carrera, con una probabilidad de Safety bastante alta. Hay que tener en cuenta que estamos en un circuito urbano y cualquier percance supone un obstaculo en mitad de una pista muy estrecha, lo que fuerza a la salida del coche de seguridad.

Las diferencias entre primero y segundo nunca han superado los 16 segundos y ha estado por debajo de los 10 en la mayoría de las ocasiones.


Esperaremos a mañana a ver si podemos lanzar algún pick y tenemos un poquito más de suerte que en el pasado gran premio.

MLB Primeros pasos

Pues como comento en el chat, ya tengo casi a punto el reto para este año de la MLB. Falta confirmar que el nivel de acierto se mantiene mas o menos estable para empezar.

Por ahora dejo los primeros datos


Las columnas en verde son las predicciones de las redes neuronales para las carreras de cada uno de los dos equipos y la del total del partido. Las flechas indican las tendencias al Over o al Under y las últimas columnas corresponden a las predicciones estadísticas al partido (positivo significa tendencia a la victoria local) y al Over Under (positivo significa tendencia al Over).

F1: GP de España

Primera carrera europea de esta temporada con grandes cambios en la mayoría de monoplazas en busca de los grandes dominadores de este comienzo de la temporada, los Brawn GP. La carrera de este fin de semana va a colocar las cartas boca arriba y en se podrán vislumbrar los pilotos y escuderías que lucharán hasta final de temporada por el título.

Ferrari y Mclaren se presentan en Montmelo con muchas novedades, aunque el resultado de las mismas parece un poco dispar. Mientras en el box de los coches de Maranello las caras eran de suave optimismo, en el equipo del vigente campeon del mundo toca sufrir. Las mejoras incorporadas en los primeros entrenamientos libres no han dado los frutos deseados y el objetivo en los entrenos va a ser tratar de colarse en la Q3.

Renault por su parte ha presentado pequeñas mejoras en el coche, pero el cambio más importante es que van a prescindir del KERS para esta carrera. Pretenden centrarse en el aspecto aerodinámico del coche, factor muy importante en este circuito.

ESTADISTICAS DE CARRERAS:

Analizando los resultados de los últimos 9 años, los pilotos con mejores resultados son Hamilton y Kubica, que aunque solo tienen dos participaciones, en todas han acabado en el top 5, y Hamilton incluso en el top 3. Este año ambos pilotos lo van a tener un poco más complicado ya que sus coches no parece que estén a la altura para seguir manteniendo estos buenos datos.

Otros pilotos que destacan por sus resultados son Massa y Alonso, ambos con un % rondando el 70% en el top 5 y con las mejoras en ambos coches creo que los dos podrían estar en ese top 5.



ENTRENAMIENTOS Y VUELTAS RAPIDAS:


Dos cosas saltan a la vista en este apartado. Rubens Barrichelo cuando ha tenido un coche competitivo (Ferrari) siempre ha estado entre los 5 primeros en entrenamientos. Nick Heidfeld por el contrario no ha clasificado nunca por encima del septimo puesto. Los pilotos de Ferrari muy irregulares en clasificación, mientras que otro gran clasificador como Trulli (ya lo dijimos en Bahrein) siempre ha estado entre los 10 primeros aunque nunca ha podido pasar del cuarto puesto. Pero el que destaca por sus buenas clasificaciones es Fernando siempre ha estado en el top 3 exceptuando un octavo lugar, incluso el año pasado con un coche nada competitivo se coló en el segundo lugar de la parrilla. El piloto asturiano se crece ante su público y creo que este año puede seguir dando la talla en los entrenamientos, en carrera será otra cosa.


CIRCUITO:


Las apareiciones del safety car en carrera no han sido demasiadas, solo en tres grandes premios de los últimos nueve. Sin embargo los abandonos son bastantes, uno de cada 3 coches no finaliza la carrera, con lo que este año con 20 monoplazas cabe esperar unos 7 abandonos. Las diferencias entre primero y segundo suelen ser superiores a los 15 segundos


PICKS para los Entrenamientos (todos en Bwin):


H2H: Hamilton over Kovalainen @ 1.3
H2H: Kubica over Heidfeld @ 1.33
H2H: Tulli over Glock @ 1.3

Para la carrera hay un top 6 de Massa a 2.3 que parece interesante pero lo dejaremos para mañana a ver como acaba el entreno y sobre todo, ver las previsiones del tiempo, que parece que hay probabilidades de lluvia para la carrera, con lo que las opciones de Masa se reducen .

Seguimos con la MLB

Ya llevo un par de años siguiendo la MLB y el año pasado nos aventuramos con un reto sobre este deporte, que parecía que tenía buena pinta. No se si lo he comentado ya alguna vez, pero la MLB cumple varios requisitos que la hacen interesante para las apuestas. En primer lugar, hay mucha información sobre esta liga, con estadísticas muy buenas. Esto es un buen punto de partida para generar modelos de predicción.

En segundo lugar es una liga que se juega durante todo el verano, cuando la mayoría de deportes que se siguen en Europa han parado. Esto permite seguir apostando de manera mas o menos continua hasta que los deportes 'europeos' vuelven de sus vacaciones estivales.

Y por último, algo que para mí es bastante interesante, los picks los puedes hacer bastante tarde al ser una competición que se desarrolla en Estados Unidos, con lo que la mayoría de partidos comienzan de madrugada.

Ahora estamos en fase de ajustar el método que teníamos el pasado año, para ver si podemos extender los picks no solo a los unders sino también a los overs y a la predicción sobre el partido. Esperaremos unas jornadas más a que los equipos y lanzadores se estabilicen y si los resultados de las pruebas lo permiten seguiremos con el reto del año pasado.

F1: GP de Barhein

Después del paréntesis vacacional volvemos con la F1 a un circuito de los modernos, en los que solo se han disputado 5 Grandes Premios. En formulaf1 teneis un muy buen análisis de las escuderías y el circuito así que me salto ese paso y vamos directamente con las estadísticas:

CARRERA:

De los pilotos que han corrido las 5 carreras el más consistente en cuanto a resultados es Kimi, con el 80% de las carreras en el podio. Fernando también ha tenido buenos resultados en este circuito, como también los han tenido Massa y Trulli. Ojo con Webber también que ha acabado en los puntos el 80% de las veces y los Red Bull vienen con la moral a tope después del 1-2 de China.



ENTRENAMIENTOS Y VUELTAS RAPIDAS:

Destaca entre todos los resultados los de Massa, que o no entra en la Q3 o clasifica primero o segundo. Trulli también lo ha hecho bien en este circuito y este año los Toyota parten con más ventaja por los test pretemporada que han hecho aquí.



CIRCUITO:

Sólo un año la diferencia entre el primero y segundo ha superado los 3.5 segundos, el % de coches que finalizan la carrera es bastante alto también y no suele ser muy común ver al Safety Car en carrera. Aunque no aparece en las estadísticas la mayoría de las veces el primer abandono se ha producido en la primera vuelta.


Esperaremos a que salgan las cuotas y tener un poco más de información para colocar algún pick.

F1: Gran Premio Malasia

Después de la apabullante victoria de los Brawn la semana pasada, dejamos Australia y nos trasladamos a Malasia, al circuito de Sepang. Un circuito moderno en el que destaca la calidad tanto del trazado como de la seguridad pasiva. Es un trazado con una gran variedad de curvas: cinco de 1ª o 2ª, y luego otras diez de 3ª o 4ª y dos rectas de 800 metros cada una, para un total de 5.543 Km. En él, el aspecto aerodinámico cobra una gran importancia ya que hay que llegar a una solución de compromiso entre el agarre en las horquillas y curvas lentas y la velocidad punta en las dos rectas. Esto va a perjudicar a las escuderías como McLaren que vienen arrastrando problemas en la aerodinámica del coche desde la pretemporada.

A diferencia de Melbourne, es una pista mucho más amplia, rápida y limpia, además el asfalto está mucho menos bacheado y las rachas de viento no son tan importantes como en el trazado australiano. Estos dos últimos factores hicieron que, según los técnicos de Renault, el coche no fuese lo suficientemente competitivo el pasado fin de semana.

Escuderías que deberían mejorar con respecto a Australia: Renault, por lo ya comentado, Ferrari, poco que decir tras el fiasco de Australia, y Williams, que tienen un coche con gran potencial y tanto Nakajima como Rogsberg se encuentran a gusto en este trazado. Esto parece que se ha confirmado en los primeros entrenos libres.

Neumáticos: Pieza clave en este gran premio. Bridgestone este año va a traer dos compuestos, duro y blando, cuando en años anteriores se optaba por el duro y el medio debido a las altas temperaturas. La durabilidad de el neumático blando será la clave.

KERS: Importante en la salida porque se puede aprovechar el exceso de potencia en la larga recta de meta, aunque habrá que tener cuidado en la horquilla final. Ferrari ha confesado que, si bien puede ser beneficioso en la salida, acelera el desgaste de los neumáticos traseros. Este punto habrá que tenerlo en cuenta cuando se monte el juego de neumáticos blandos.

Climatología: Se preveen lluvias tanto para carrera como para entrenamientos. La carrera se celebra a las 17:00 hora local, con lo que existe la posibilidad de que la visibilidad sea muy baja debido a la lluvia y a la falta de luz. Este factor incrementa las probabilidades de accidente y debería afectar también negativamente a la cantidad de coches que finalicen la carrera.

Pilotos que se crecen en Sepang: Batton, Alonso (es su circuito favorito), Heifield y Nakajima.

Resultados de las últimos 8 años en carrera:

Destaca Alonso que incluso corriendo con Minardi ha llegado a terminar en los puntos.

Resultados Entrenamientos y vueltas rápida en carrera:

Massa y Alonso son los hombres Pole del circuito, y en carrera Kimi parece que mejora sus resultados.

Resultados del circuito:


Circuito exigente para los coches con una media de abandonos del 32%, no ha habido ningún safety car en los últimos años, pero este año dependiendo de la lluvia las cosas pueden cambiar. Las diferencias entre el primero y segundo son muy variables.

Con todo esto vamos con, todo en Paddy Power:

Alonso en los puntos @ 1.8. Los Renault deben mejorar en este circuito, es el circuito preferido de Alonso y siempre ha acabado en los puntos excepto un año con Minardi. Además si aparece la lluvia Alonso es uno de los mejores pilotos en estas circunstancias.

K Nakajima en los puntos @ 3.00 Ya hemos visto que los Williams son rápidos y el piloto japonés ha corrido ya varios años en el circuito cuando era piloto de la GP2 en Japón. Confiamos en él para esta carrera.

Escudería con más puntos: Ferrari @ 3. Barrichelo sale 5 puestos atrás por sustituir la caja de cambios, la fiabilidad de los Brawn está por demostrar y Ferrari no se puede permitir otro fiasco.

Esperemos tener un poco más de suerte que el otro GP.

Llega la Formula1

Pues ya tenemos aqui de nuevo a la F1, con muchas modificaciones respecto a la temporada pasada, y si no que se lo digan a Hamilton, que le ha tocado vivir lo que vivio Alonso en la temporada pasada.

Los KERS, alerones moviles, neumaticos lisos, una sola marca de gomas... Bueno a lo que voy que esta primera carrera es una lotería. Por lo visto en la pretemporada parece que los Brawn han hecho un gran trabajo, ¡quien lo iba a decir despues de estar casi fuera y que en la pasada temporada no se comian un rosco!. Muchos opinan que han hecho estos tiempos buscando un patrocinador para toda la temporada, se ha hablado de Bwin y de Virgin, aunque parece ser que no se ha concretado nada todavía. Otros equipos que han trabajado bien son Williams, Toyota y Renault.

Para la carrera, llevarán Kers Renault, McLaren, Ferrari y Heifield. Bmw lo decidirá carrera a carrera y en esta Kubica no va a ir con el por el tema del peso. Es uno de los pilotos más altos de la categoría y también con más peso. Según parece para los entrenos no se gana demasiado pero en carrera puede ser una ayuda en adelantamientos aunque el paso por curva, al llevar más peso, puede ser un poco más lento.

En cuanto a estadisticas, este es uno de los deportes que menos páginas de estadísticas buenas he encontrado, solo tengo dos interesantes:

http://www.statsf1.com/
http://www.grandprixstats.com/en/

Tengo la intención de hacer una buena recopilación de estadisticas antes de cada carrera, pero ya empezamos un poco justos para esta, así que a ver si en la siguiente podemos hacerlo un poco mejor.

Pilotos que se crecen en este circuito: Raikonen (8 participaciones, 4 podiums, 4 vueltas rápidas), Alonso (7 participaciones, 4 podiums, 1 vuelta rápida), Hamilton (2 participaciones, 2 podiums), Barrichelo (13 participaciones, 4 podiums, 1 Vuelta rapida) y Rogsber (3 participaciones, 1 podium). Todos ellos deberían estar por delante de sus compañeros de equipo en los H2H tanto en carrera (mucho más probable) como en calificación.

Pilotos que no les va mucho: Massa (6 participaciones, 1 vez en los puntos), Trulli (12-2), Button (9-1, aunque con 1 pole).

Así que para la lotería de la carrera yo voy con (todo en PaddyPower y Stake bajito 1):

Escudería con más puntos: Williams @6 (esperemos que Nakajima no nos gaste una mala pasada)
Vuelta rápida: Raikonen @5
¡¡¡A MADRUGAR TOCAAAAA!!!

Resumenes gráficos de variables en escala ordinal

Los gráficos utilizados en el resumen de datos para variables en escala ordinal son los mismos que para el caso de variables en escala nominal, es decir, histogramas o gráficos de barras y diagramas de sectores. La única diferencia la encontramos en la interpretación del histograma. En los gráficos de escala nominal, la posición de cada una de las categorías era indiferente, mientras que en este caso la posición nos informa sobre el orden en el que se encuentran las categorías.

Veamos un ejemplo. Utilizamos los mismos datos que en la entrada anterior de representaciones gráficas:

Este gráfico

Es exactamente el mismo que este otro:

Lo único que hemos hecho es reordenar las categorías. Sin embargo con datos en escala ordinal, la forma del gráfico si que es importante, ya que las categorías SI estan ordenadas.

Ejemplo posición en parrilla de salida de Alonso y Piquet

Aquí se puede ver que las barras naranja (Alonso) se encuentran agrupadas más a la izquierda (puestos mejores en parrilla) que las barras azules (Piquet).

El objetivo de esta representación gráfica es simplemente mostrar diferencias en las distribuciones. Podemos encontrar diferentes formas de distribuciones a simple vista, pero para confirmar estas diferencias habría que hacer uso de los test de hipótesis, que supongo veremos en posteriores entradas.

Lo único que haremos por ahora es estimar probabilidades y comprobar que se ajustan a las cuotas ofertadas por las casas. Así, recuerdo un pick que puse en Forobet al comienzo de la temporada de F1 sobre un H2H entre Alonso y Piquet. La cuota estaba en torno al 1,15 para la clasificación y a mi me parecía un regalo. Era una 'chiquicuota', como se le suele llamar, pero para mi, esta cuota no debería haber pasado de 1,01 o 1,02. Y los datos al final de la temporada así lo han demostrado. Nelsiño no ha ganado ningún H2H en clasificación a Fernando. Si la cuota hubiese sido correcta, supondría una probabilidad de 1/1,5*Fracción de pago (suponemos un 85%) = 74%

Multiplicando este 74% por el total de carreras (18) supondría un 13-5 a favor de Alonso, cuando ha sido un 18-0. Después de hacer un simple test de hipótesis con estos datos, podemos decir que hay evidencias estadísticas que demuestran que la cuota colocada no era correcta. Es decir, habiamos encontrado un autentico value. Con lo que la apuesta estaba más que justificada.

Resumenes gráficos de variables en escala nominal

Las dos formas más frecuentes de resumir gráficamente variables de escala nominal son los diagramas de barras y los diagramas de sectores. Lo que se representa en ambos casos es la cantidad de eventos que se han dado en cada una de las categorías. Es importante señalar, que el orden en el que se presentan las categorías no tiene ningún significado.

En apuestas deportivas no es fácil encontrar casas que nos ofrezcan apuestas relacionados con variables en escala nominal. Uno de los pocos ejemplos que podemos encontrar son apuestas al primer evento que se puede producir en un partido de futbol. Bwin es una de las pocas casa en las que se pueden encontrar apuestas de este tipo y hace un par de semanas ofrecían lo siguiente para el partido entre el Cluj y el Chelsea (lo he seleccionado en honor a mi compañero Baldani que es un apasionado de la liga Rumana):

Primer evento en la primera parte

1. Tarjeta @ 1.7
2. Gol @2.65
3. Sustitución @15
4. Medio tiempo @8.5

Este es un claro ejemplo de variables en escala nominal. Se ofrecen 4 categorías diferentes con sus cuotas entre las cuales no existe ningún tipo de relación de orden, entendiendo por orden, el que una categoría sea mayor a otra. Evidentemente no se puede decir que tarjeta sea mayor que sustitución o que gol sea menor que medio tiempo.

Para realizar nuestro resumen utilizaremos los datos que ofrecía la propia Bwin. Allí podíamos encontrar los resultados de los dos equipos en sus seis ultimos encuentros y además entrando en cada uno de los partidos podíamos ver los detalles del mismo. Esta será nuestra fuente de datos para este ejemplo.

Iremos partido por partido apuntando el primer evento hasta obtener una columna con 12 datos (6 datos por cada equipo)

Una vez tenemos esto, el siguiente paso es construir un histograma y esto se puede hacer de varias formas en Excel. La que más utilizo, porque creo que es la más rápida y flexible es la tabla dinámica, aunque también se pueden usar otras como los subtotales, la función histograma implementada en el complemento de análisis de datos, la función de excel frecuencia() o la más simple contar.si(). Es esta última la que vamos a explicar en este ejemplo.

El resultado final que vamos a obtener es una hoja como esta:

En la que en la columna D tenemos los datos de los partidos, que hemos ido sacando de Bwin y en las columnas H-I-J-K tenemos los resultados.

Así, partiendo de la tabla de datos, vamos a crear la siguiente:

En la primera columna colocaremos los cuatro tipos de eventos. IMPORTANTE, la función contar.si() no distingue entre mayúsculas y minúsculas, pero si es sensible a los espacios entre palabras o al final de las mismas. Así que, lo que recomiendo, es copiar y pegar los identificadores de cada una de las categorías para no equivocarnos al teclear.

En el resto de la tabla introduciremos la siguientes fórmulas. Los $ supongo que sabeís para que sirven, y se colocan SOLO EN WINDOWS pulsando [F4] repetidas veces, para fijar la celda, la columna o la fila. Volveremos sobre esto en otras entradas.


La columna de frecuencias la obtendremos con la función contar.si() de Excel, que tiene dos argumentos. El primero es el rango donde se encuentran nuestros datos, y el segundo es el criterio, lo que queremos que Excel cuente. Para nuestro ejemplo el rango de datos siempre es el mismo y lo fijamos con los símbolos de $ para que no varíe al arrastrar la función y el segundo es el nombre de la categoría. Con esto conseguiremos que Excel nos cuente la cantidad de veces que aparece el nombre de la categoría en el rango de datos que le hemos dado. A esto habitualmente se le llama frecuencia.

En la siguiente columna hemos calculado un cociente entre la frecuencia de cada categoría y el total de elementos que tenemos. Esto representa la cantidad de elementos que tenemos de cada categoría con respecto al total. A esto se le llama frecuencia relativa y se suele representar en porcentajes, porque también coincide con la probabilidad de que se de un resultado de esa categoría.

Y con esto tenemos ya nuestro resumen gráfico en forma de histograma


Que podríamos representar también en diagrama de sectores:


Como podeis ver en este caso los % coinciden con las frecuencias relativas que hemos calculado en la tabla.

El último paso que nos quedaría sería el de utilizar estos datos para evaluar las cuotas que nos ofrecía Bwin. Si considerasemos como representativos estos seis partidos de cada equipo para evaluar el partido en cuestión, las cuotas que Bwin debería haber ofrecido serían las mostradas en la última columna de la tabla. Para su cálculo simplemente divdiremos 1 por la frecuencia relativa. Comparando estas cuotas teóricas con las ofrecidas por Bwin vemos que existe una discrepancia en la de Sustitución, que Bwin la ofrecía a 15, mientras que en nuestro cálculo habíamos obtenido 6. Esta sería para nosotros una apuesta de valor (value bet) y sería la que deberíamos elegir.

Antes de acabar puntualicemos varias cosas, por si las moscas.

1. Los datos de partida son inventados, pero las cuotas eran las reales
2. No es muy conveniente utilizar solo 6 partidos como un estimador razonable. Cuando se usan tablas de contingencia se habla de que hay que tener como mínimo 5 datos por cada casilla. En nuestro caso sería conveniente tener al menos 5 datos para cada una de las categorías, lo que solo se cumple para una de ellas.
3. Es muy probable que la value bet que obtengamos no sea la que tiene una probabilidad más alta de salir, lo que quiere decir que es probable que no salga. Pero, pero, pero, si seguimos utilizando este método y nuestros análisis son correctos, la frecuencia con la que se irán dando los aciertos hará que se compensen las pérdidas a largo plazo.

Creo que ha sido un pequeño ladrillo para comenzar la semana. Espero que no se haya dormido nadie. Hasta otra