Mostrando entradas con la etiqueta Simulaciones. Mostrar todas las entradas
Mostrando entradas con la etiqueta Simulaciones. Mostrar todas las entradas

martes, 23 de abril de 2019

Simulaciones - La distribución binomial


Continuamos la serie de entradas sobre simulaciones de distribuciones estadísticas. Hoy llegamos a la distribución binomial. Como en toda la serie, y ese es uno de sus objetivos, usaremos la hoja de cálculo Simulador. Aunque la hayas descargado en otra ocasión, es conveniente que lo vuelvas a hacer, pues se le han añadido nuevas prestaciones, como la imitación de la máquina de Galton con probabilidad prefijada.

Se encuentra en las direcciones


Versión LibreOffice: 


y la puedes descargar para tu uso.

Distribución binomial

 Esta importante distribución se aplica a pruebas repetidas de la ley de Bernouilli


con las siguientes condiciones:

a) Se realizan experimentos repetidos del tipo Bernouilli, n en total.
b) La probabilidad p permanece constante en todos ellos
c) Cada experimento es independiente del resultado anterior.

Llamamos a n el número de intentos. Estamos interesados en estudiar el número de veces que aparece el suceso A (éxito). A su número de ocurrencias le llamaremos número de éxitos.

Por tanto la ley binomial se aplicará cuando repetimos un experimento cumpliendo las condiciones a), b) y c) establecidas y deseamos estudiar el número de éxitos que obtendremos. Son de este tipo las tiradas múltiples de monedas, de dados, de ruleta, ...

La probabilidad de obtener r éxitos en n intentos se demuestra que equivale a


En  ella el paréntesis es el número combinatorio n sobre r. Del hecho de que esta fórmula sea muy similar a la del Binomio de Newton proviene el nombre de binomial.

La media (esperanza matemática) de esta distribución viene dada por

y su varianza por


Consecuencia de esta es una fórmula que nos será muy útil, y es la de su desviación típica, que viene dada por

La distribución binomial de probabilidad p y número de intentos n se representa generalmente por B(n,p)

Puedes completar su estudio en


Uso de la hoja Simulador

 Comenzamos con un ejemplo, para estudiar la forma de plantear una simulación de este tipo. Habrá que concretar algunos parámetros, al igual que se hizo en simulaciones anteriores.

Tiramos 100 veces tres monedas. ¿En cuántas de ellas esperamos obtener tres caras?

La distribución binomial contiene decisiones automáticas en el Simulador, por lo que sólo hay que fijarle los siguientes parámetros:

·        Número filas y columnas: 100 filas y una columna (en este caso)
·        Tipo de simulación: Binomial (usa el desplegable)
·        Número de intentos: Lo escribes como parámetro A. En este caso son 3.
·        Probabilidad: Se escribe como parámetro B. Si deseas usar fracciones, escribe delante el signo =. Así, en el ejemplo escribiríamos =1/2.

El resto de parámetro lo rellena la hoja.

En la imagen observamos que ha fijado el número de intervalos en 4, para contar con el 0.


Los parámetros que no cambian se ignoran, como por ejemplo, 2 y 77.

Pulsamos sobre el botón “Simulación” y obtenemos los resultados de la simulación:

Número de veces en el que resultan tres caras:


Nos resultan 11 veces. Repetimos simulación y obtenemos 14, 16, 13, 14, 9, 17,…Esta variabilidad confirma lo peligroso de obtener conclusiones con solo 100 repeticiones. La simulación siempre es orientativa, pero se debe efectuar con más ensayos.

En este caso binomial también se pueden consultar los intervalos en la segunda hoja. Escribimos como extremos a y b el mismo número esperado de caras, 3, en la primera columna y nos devuelve el número de casos obtenido. En la imagen no aparece el 11, sino 16, porque corresponde a otra simulación:



Estudio con funciones de hoja de cálculo

Otra forma de responder a la cuestión es mediante las funciones estadísticas de Excel y Calc. Aquí estaría indicada DISTR.BINOM.N(X;N;P;Tipo) En ella escribimos los parámetros siguientes:

·        X es el punto en el que deseamos consultar la distribución, el resultado que esperamos. En este caso sería x=3, porque esperamos tres caras.
·        N es el número de intentos, que aquí también es 3.
·        P representa la probabilidad, que en monedas es 0,5
·        Tipo indica si la distribución es acumulada o no. Si su valor es 1, la distribución es acumulada y con 0 sin acumular. En el ejemplo deseamos no acumular. Sólo nos interesa el caso de 3 caras.

La escribimos en una celda y obtenemos: DISTR.BINOM.N(3;3;0,5;0)=0,125
Luego para 100 tiradas, el valor esperado sería 12,5. En la simulación obtuvimos 11, 14, 16, 13, 14, 9, 17,…Esto da idea de la variabilidad que presenta nuestra simulación.

Póquer con dados

En el juego familiar de póker con cinco dados, obtendremos póquer cuando cuatro de ellos marquen un mismo valor. Estudiaremos el caso en el que aparezcan en la primera tirada, sin comodín y sin acudir a otras tiradas, un póquer de reyes, por ejemplo. Se considera un suceso difícil. Lo simulamos:

·        Tipo: Binomial
·        Parámetro A: 5 dados
·        Parámetro B: Probabilidad 1/6 (lo escribimos como =1/6 y obtendremos 0,1666…)
·        Repeticiones: 500



Con ese número de repeticiones, no resultan en la simulación ni póquer de reyes ni repóquer:



Las frecuencias del 4 y el 5 son nulas, luego nuestra intuición de que son sucesos improbables no iba descaminada. Sobre el 500 escribimos un 2, para obligar a repetir la simulación dos veces.



Esta vez, con 1000 intentos sí se ha conseguido un póquer de reyes en una de las tiradas:


Aquí hemos trabajado con un solo valor en el resultado (reyes), pero el póquer puede salir con cualquier valor, lo que, al ser sucesos disjuntos, multiplicaría por 6 la probabilidad, pero es tan pequeña, que la simulación vale para darnos una idea de su dificultad.

Un ejemplo con intervalos

En un bombo de lotería se han introducido 100 bolas, numeradas del 00 al 99, con lo que todas las decenas figuran con 10 elementos. La probabilidad de obtener a ciegas una bola cuyo número comience por 3, será de 10/100=0,1
Imaginemos que 200 personas van sacando 10 bolas con reposición y contando las veces en las que obtienen un 3 en las decenas. ¿Cuántas de ellas esperaríamos que obtengan entre 3 y 10 éxitos?


El planteo sería:

·        Una repetición con 200 filas (200 personas)
·        Número de intentos: 10
·        Probabilidad: 1/10


Preparamos los intervalos de la segunda hoja para contar entre 3 y 10. Iniciamos la simulación y obtenemos:


Nos dan 9 casos, con una frecuencia relativa de 0,045. Fijamos ahora el experimento con 10 repeticiones (parte alta del cuadro de parámetros), pero en este caso el botón de intervalos no nos sirve, porque funciona sobre las filas de la simulación, pero no acumula. Mejor es leer las frecuencias de la tabla y sumar:



Entre 3 y 10 se han obtenido 124+17+3=144, que comparado con 2000 repeticiones nos da una frecuencia relativa de 144/2000=0,072, que parece más ajustada a la realidad que el 0,045 que obtuvimos con una sola tirada.

Podemos acudir a la función DISTR.BINOM.N(). En este caso restaremos la función acumulada en 10 de la acumulada en 2:

DISTR.BINOM.N(10;10;0,1;1)-DISTR.BINOM.N(2;10;0,1;1)=0,07019
Se observa, como era de esperar, que la frecuencia en la simulación repetida (0,072) se acercaba más al valor teórico (0,07019).

Aproximación a la normal

Se sabe que la distribución binomial se acerca a la normal bajo ciertas condiciones. Puedes repasar esta cuestión en 


Normalmente se piensa en la distribución normal cuando el valor de p es cercano a 1/2 y N tiende a infinito, aunque se suele obtener una buena aproximación práctica para N>30. Todo esto es un poco empírico, y se basa en el Teorema de Moivre, que puedes consultar en 


Ahí también se incluyen otros consejos para poder usar esta aproximación. Sólo queda indicar que la distribución normal límite poseería la misma media y desviación típica que la binomial.

Para ilustrar este ajuste, elegimos una binomial de 10 intentos y probabilidad 0,5, la simularemos en 100 filas con 10 repeticiones:



Con estas condiciones la media es 5 y la desviación típica 1,5811. Procedemos a la simulación y obtenemos, efectivamente, un resultado que se aproxima a la distribución normal:



Podemos estudiar el ajuste mediante la función =DISTR.NORM.N(x;M;D;0), que da la frecuencia para un valor dado en la distribución normal de media M y desviación típica D. Hemos incrementado el número de elementos a 1000, dejando en 10 el de repeticiones. A la tabla de frecuencias le hemos añadido esta función de Excel, con el siguiente resultado:



El buen ajuste se puede observar entre la columna de simulación y la de normal. La columna intermedia proviene de la función =DISTR.NORM.N(x;5;1.5811;0) y la última se ha creado multiplicando por N, que aquí es 10000.

Gráficamente se percibe mejor el buen ajuste:



La máquina de Galton como curiosidad

En la nueva versión del Simulador se ha añadido una hoja nueva con el experimento de Galton. Este modelo ya se ofrecía en nuestro curso de Estadística y en otros materiales, pero la nueva versión admite fijar una probabilidad que no tiene que ser necesariamente 1/2. De esta forma se puede visualizar una distribución binomial no centrada en la máquina. Lo puedes ver en esta imagen, correspondiente a p=0,7:



Observamos su sesgo hacia la derecha y su ajuste razonable a la distribución binomial teórica. En el gráfico se observa mejor el ajuste:



Con esto dejamos el tema de la simulación binomial. Se podía extender algo más, pero alargaría el texto.




lunes, 11 de febrero de 2019

Simulaciones - Distribución normal


Simulación normal

Seguimos hoy la serie de simulaciones que iniciamos en


En esas entradas vimos la distribución uniforme y la de Bernouilli. Hoy lo haremos con la normal.

Nos basaremos en esta también en las prácticas de nuestro curso de Estadística, (http://www.hojamat.es/estadistica/iniestad.htm) adaptándolas al formato de un blog. Usaremos nuestro Simulador implementado para hojas de cálculo, el cual puede sufrir cambios a lo largo de la serie, por lo que se aconseja su recarga en caso de duda.

Distribución normal

Si no recuerdas la distribución normal puedes acudir a la Teoría correspondiente

Por ahora basta con saber que siguen esa distribución normal de forma aproximada muchos datos tomados de nuestra vida diaria:

  • Magnitudes que dependen de muchas causas independientes, cuyos efectos se suman y cualquiera de ellas aislada tenga efectos despreciables.
  • Distribuciones de errores en las medidas.
  • Medidas de tipo antropológico (estaturas, pesos, inteligencia...) y biológico (glucemia, nivel de colesterol...)
  • Límite de otras distribuciones estadísticas cuando n aumenta.
  • Todas ellas producen gráficos con forma de campana de Gauss, más o menos aproximada.



Nuestro simulador puede producir datos aleatorios que sigan esta distribución normal.

Puedes descargarlo para Excel


Y para LibreOffice Calc


Esta herramienta está en desarrollo, por lo que debes ignorar las hojas no terminadas.

La forma más práctica de plantear una simulación de este tipo es la de dar el promedio de los datos y la desviación típica, pero también funciona conociendo el mínimo y el máximo esperados.

Lo vemos con algún ejemplo:

Los de más altura

En un Centro de Enseñanza se han tallado todos los alumnos y alumnas de un nivel, 128 en total y ha quedado como estatura mínima la de 140 cm, y como máxima, 198 cm. Si deseamos seleccionar a aquellas personas con estatura superior a 180 cm. ¿Cuántas esperaremos encontrar?

La teoría estadística puede responder a esta pregunta mediante las propiedades de la distribución normal. Aquí lo intentaremos con el Simulador:



Hemos concretado lo siguiente:
  • ·        Distribución normal con decimales (son estaturas) usando máximo y mínimo
  • ·        Mínimo 140 y máximo 198
  • ·        Una columna de 128 filas (número de alumnos y alumnas)
  • ·        Diez intervalos

Procura localizar bien todos esos datos en sus celdas correspondientes. Pulsa el botón “Simulador”.

Con este planteamiento la simulación se aproximará bastante a las medidas reales. Si pasas a la segunda hoja advertirás la forma típica de campana de esta distribución, y que la estatura media es aproximadamente de 169 cm., y la desviación típica cercana a 8. No podemos pretender resultados idénticos a los previstos por la teoría, pero comparando los estadísticos de la simulación con los valores teóricos, vemos que existe una buena aproximación.


La gráfica también tiene forma aproximada de campana, aunque con tan pocos elementos de simulación, nunca seguirá ese tipo teórico:


También, de paso, hemos descubierto que esperaremos unas 12 personas con más de 180 cm. Afinamos esto más. Busca el apartado de Intervalos en la hoja de 
resultados



Con esta tabla podemos contar fácilmente resultados sin tener que recorrerlos. 

Tiene un funcionamiento simple, y es el de escribir en la columna correspondiente (en nuestro caso la primera, porque solo hay una) los extremos entre los que deseamos contar resultados. En nuestro caso serían 180 y 198, que es el máximo. Ahora basta con pulsar el botón Intervalos y nos devolverá la frecuencia absoluta, 14, y la relativa, 0,11 aproximadamente, un 11%.

Repitiendo la simulación han resultado, en varios intentos, 15, 11, 8, 11  y 15, por lo que juzgamos que lo más probable es que nos encontremos con unos 11, lo que nos permitirá organizar un equipo de baloncesto, si ese era el objetivo.

Si conoces algo de la teoría de esta distribución, sabrás que existen funciones y tablas que te devuelven este dato de forma teórica, pero nuestro objetivo estaba en recoger los datos de una simulación, no en prever el resultado. En nuestro caso, y no seguiremos con el tema, la aproximación sería:

1-DISTR.NORM.N(180;169;8,2857;1)=0,092157044

Un poco menor que la obtenida del 11%, en este caso un 9,2%. Así funcionan los resultados en las simulaciones. Nunca esperes aproximaciones destacables.


Un ejemplo con media y desviación típica

Una población de 500 personas con riesgo de diabetes en una ciudad ha presentado un promedio de 106 mg/100ml de nivel de glucosa en sangre y una desviación típica de 8 mg/100ml. Diseñar una simulación para encontrar a partir de qué nivel encontraremos las 50 personas con más riesgo.

Organizamos la simulación, pero usando ahora media y desviación típica:



Obtendremos una columna con 500 niveles de glucosa y una distribución en forma de campana de Gauss.



En nuestra simulación se obtuvieron media y desviación bastante cercanas a las teóricas:


Si ahora deseamos obtener los cincuenta niveles más altos, nos bastará con ordenar la columna G de la primera hoja (de mayor a menor) y observar n qué nivel se encuentra el número 50:

Vemos que hay que comenzar por el nivel 116,4 para así poder seleccionar los 50 posibles pacientes con más riesgo. Si repites la simulación varias veces podrás quedarte con una media más aproximada.

También podemos trabajar con los intervalos cambiando el mínimo hasta obtener un resultado aproximado de 50 personas. En otra simulación nos da un tope de un nivel de 114 o 115:

Como en el caso anterior, se puede acudir a la teoría:

INV.NORM(0,9;106;8)=116,25

Hemos tomado de probabilidad 0,9 porque los 50 en una simulación de 500 representa un 10% superior y un 90% inferior. Nuestra simulación se queda un poco corta.

Medidas válidas

En una medición con mucho riesgo de errores se ha decidido rechazar aquellas medidas que se alejen de la media más de una desviación típica y media. Supongamos que en mediciones anteriores resultó una media de 65 y una desviación típica de 8. ¿Qué número aproximado de mediciones debemos efectuar para garantizarnos 200 medidas catalogadas como válidas, si la distribución en la población se puede considerar normal?

De nuevo acudimos a una simulación. Según los datos que nos dan, las medidas válidas estarán entre 65-3*8/2 y 65+3*8/2, es decir, entre 53 y 77. Comenzamos una simulación de 250 mediciones y concretamos 14 intervalos.

Observamos, de forma aproximada, que habría que desechar unas 10 medidas inferiores y unas 15 superiores, lo que nos daría 250-10-15=225 medidas válidas.


Esta observación se confirma también con intervalos:



Probamos con 230 simulaciones, pare ver si nos acercamos a 200 válidas.

Después de la simulación hay que desechar 16+18=34, con lo que nos quedamos cortos, 196. Subimos y bajamos el número de simulaciones y 230 parece quedar en la media, luego es aconsejable usar muestras de 230 medidas.

Esto ha sido una especie de juego. Si acudimos a la distribución normal teórica, descubriremos que el porcentaje esperado de medidas que se alejen más de 3/2 de desviación típica por un lado es de 0,066807201. Por los dos lados será 0,133614403, y restando de 1, el porcentaje de medidas válidas sería 0,866385597. Dividimos 200 entre ese porcentaje y obtenemos 230,844096.
Nuestra simulación no estaba descaminada.

Con este experimento también hemos aprendido que los porcentajes no dependen de una media concreta sino de la medida tipificada Z, que en este caso valía Z=1,5.


Obtención de muestras

En el caso de la distribución normal es muy interesante el disponer de muestras de un colectivo del que sabemos algunos parámetros (generalmente media y desviación típica). Vemos algunos ejemplos:

Distribución de errores

75,6       78,0       77,8       77,5
75,2       79,0       76,8       78,0
76,5       76,8       76,6       77,2
77,3       78,4       76,6       76,6
77,1       77,6       77,3       76,1

Los datos anteriores simulan 20 repeticiones de una medida. A simple vista parece que la media es 77. En el Simulador se ha obtenido media 77,1 y desviación típica 0,9. Esta tabla puede servir para que el alumnado obtenga también la media, la  desviación típica y la gráfica, para saber si se aproxima a la distribución normal. Con el Simulador se pueden preparar rápidamente distintas muestras para un trabajo por equipos. También  puede aprenderse en clase el funcionamiento de esta herramienta y que los grupos simulen su propia muestra.

Colesterol en sangre

Esta muestra ha sido generada mediante el Simulador:

221,0     205,9     208,2     224,8     205,3     209,7     220,8     229,7
202,8     215,2     203,6     240,7     215,8     236,4     234,6     213,6
189,0     212,7     197,4     203,2     175,4     218,4     227,6     222,4
246,2     238,8     211,5     229,4     206,4     195,8     179,4     206,3
220,4     234,2     207,5     184,7     204,5     224,4     220,2     199,3

Se puede intentar adivinar en clase qué media se ha usado, e investigar si estos datos entran en lo que es frecuente en la vida real.

Cociente intelectual

A la vista de esta tabla, se puede discutir qué media y desviación típica se usa y seguir investigando en Internet:

103        87          106        57          100
62          88          81          98          83
102        90          98          103        100
109        76          93          99          100
107        84          75          104        105
91          96          111        121        108
93          89          89          88          92
71          85          92          104        83
82          97          88          91          82
103        85          110        108        94
84          101        94          86          97
105        92          85          120        121






lunes, 10 de diciembre de 2018

Simulaciones - Experimento de Bernouilli


Todos tenemos la experiencia de encuestas de opinión que no aciertan, o pronósticos de lluvia que no se cumplen. Solemos exigir a la Teoría de la Probabilidad y a la Estadística resultados que no nos pueden dar. Con esta simulación intentaremos comprobar las propiedades ya sabidas de los experimentos aleatorios:


  • Repetido un experimento aleatorio en las mismas condiciones, no tiene que dar los mismos resultados.
  • Los resultados son imprevisibles.
  • En general (no siempre), cada experimento suele ser independiente de los anteriores y no se ve influido por ellos.
  • A pesar de lo afirmado, en largas series de repeticiones de un experimento aleatorio se observan unas ciertas regularidades.


Usaremos la hoja de cálculo Simulador, programada en LibreOffice Calc y Excel, que para la simulación que se propondrá funcionará perfectamente.

Está alojada en

Versión Excel:
http://www.hojamat.es/estadistica/tema1/open/simulador.xslm

Versión LibreOffice:

http://www.hojamat.es/estadistica/tema1/open/simulador.ods

La puedes descargar para tu uso.

Para entender algo mejor la relación entre probabilidad y frecuencia simularemos una distribución de Bernouilli, que es la más sencilla de todas. Consiste en imaginar un suceso, por ejemplo tirar un dado y que resulte un 6, y construir una variable cuyo valor sea 1 si ocurre ese suceso y 0 si no ocurre. Así, el 1 tendrá probabilidad 1/6 de salir y el 0, suceso contrario, 5/6, es decir, mucho más probable. Suponemos que en una serie de intentos, el resultado de cada uno no se ve influido por los anteriores.

Primera simulación

Imagina que disponemos de una bola roja y dos blancas en una bolsa, y que extraemos varias veces una bola, la identificamos y la devolvemos a su sitio. Esperaremos que por cada vez que salga una roja aparecerán dos blancas, es decir, intuitivamente asignamos a la roja (que representaremos por el 1) una probabilidad de 1/3 y a las blancas una de 2/3. Si repetimos el experimento muchas veces tendremos la expectativa de que la frecuencia de las blancas será el doble que la de la roja. Observa estas tiradas que hemos conseguido con el simulador:


En ella han aparecido 39 ceros y 21 unos. Como contiene 60 tiradas, habríamos esperado 20 unos (rojas) y 40 ceros (blancas). Existe, pues una diferencia de una unidad, o expresado en porcentaje del  1,67%.

La primera idea que debes tener respecto a la relación entre probabilidad (tu expectativa previa) y la frecuencia observada después de un experimento es que presentan valores bastante aproximados, pero no exactos, salvo casualidades.

Si no se tiene en cuenta esto, dejaremos de creer en los sondeos de opinión o los pronósticos meteorológicos, porque creeremos que se equivocan. Se debe pensar siempre que estos experimentos miden nuestras expectativas, y no la realidad. ¿Se puede intentar disminuir la diferencia entre frecuencia y probabilidad? Pues sí y no. Seguimos hablando de expectativas: si aumentas el número de experimentos esperarás que el error en porcentaje disminuya, pero tampoco esto te da seguridad. Siempre medimos la esperanza y no la certeza. Inténtalo tú:

Abre el simulador y trabaja en su primera hoja Simulación. Sigue estos pasos:
Como tipo de simulación elige Bernouilli con el desplegable:


Como parámetro A, situado en el bloque Otros parámetros, y que contendrá la probabilidad, escribe esto: =1/3, y te dará un valor de 0,3333:



En el ejemplo hemos simulado 60 repeticiones del experimento. Puedes aumentar a 30 filas por 9 columnas (o bien otro valores) para que nos resulten 270 intentos



Señala como mínimo el 0 y como máximo el 1:



Para terminar, en la parte baja del cuadro concreta como criterio Máximo-Mínimo, y, más abajo, número de intervalos igual a 2. Capturamos el cuadro completo:



Observa que hemos dejado la Media y la Sigma de una simulación anterior, porque no van a intervenir. Con esto tienes definido un nuevo experimento con más repeticiones. Según el carácter de los fenómenos aleatorios, esperaremos un error menor, pero eso nunca es seguro.

Pulsa el botón Simulador.




Te aparecerán muchos unos y ceros. A nosotros nos resultó esto:



No vas a contar todos esos ceros y unos. Pasa a la siguiente hoja, Estadísticos, y lee las frecuencias:



En nuestro caso, en lugar de 180 y 90, que sería lo esperado, hemos obtenido 184 y 86, con un error de 4 unidades, 4,44% de error. Luego el error ha aumentado. No te puedes fiar de los fenómenos aleatorios.

Es muy probable que tú hayas obtenido mejor resultado. Lo hemos repetido y los errores obtenidos han sido 10, 1, 2, 5,  0, 8, 7, 6,…Como ves, muy variables y con poca fiabilidad. Es posible que tú también hayas obtenido resultados bastante dispares.

Si deseas introducirte en la Estadística debes aceptar este hecho. Sólo son seguros los resultados posteriores a un experimento, y no nuestras expectativas previas.

Seguimos insistiendo. Ese error hay que reducirlo. Para ello aumentaremos aún más el número de experimentos. Busca la casilla de Repeticiones de la simulación y marca 20 repeticiones, lo que equivale a 5400 experimentos.

Pulsa de nuevo en el botón Simulador y verás oscilar los datos 20 veces. Pasa a la hoja Estadísticos. Lee las frecuencias. A nosotros nos han resultado 1738 bolas rojas y 3662 blancas, en lugar de las esperadas 1800 y 3600, con un error de 62 bolas, que representa un 1,1% de error. Es una mejora, pero no espectacular.

Como regla empírica se suele tomar un 3% de error esperado en 1000 experimentos (esto tiene fundamentación teórica).

Si comparas los valores obtenidos en los estadísticos de la simulación en comparación con los teóricos, la impresión de buen ajuste mejora:



También parece que una columna es el doble de alta que la otra en el gráfico:



Hemos aprendido que cuando se realiza un experimento aleatorio el error que hay que medir es el relativo, el porcentaje, que calculas dividiendo el error absoluto (aquí 62 bolas) entre el total de experimentos (540) y pasarlo, si se desea, a porcentaje.

Hemos repetido el experimento de los 5400 intentos y nos han aparecido estos errores:
0,02%, 0,07%, 1,02%, 0,46%

En conjunto es más fiable que el primer experimento.

Si deseas simular experimentos en los que confíes que se dé una proximidad entre probabilidad y frecuencia, deberás aumentar el número de experimentos (con el consiguiente gasto. Por ello son populares los sondeos con 1000, 5000 o 10000 encuestados, pero no más).

En este ejemplo de Bernouilli conocemos la probabilidad, pero en un sondeo o una previsión meteorológica no lo sabemos y tendremos que manejarnos con cotas de error (ya lo irás viendo)

Por curiosidad, hemos aumentado el número de repeticiones a 200 (tarda un poco), es decir, 54000 experimentos, consiguiendo un error de 0,2%.

Si deseas afinar más tus resultados deberás aumentar el número de repeticiones, con el consiguiente gasto en tiempo y dinero.

NOTA: En estas simulaciones estamos juzgando la exactitud de la función ALEATORIO de las hojas de cálculo. Si esta no está bien programada sufriremos errores sistemáticos, pero como nuestro objetivo es aclarar conceptos, no parece muy grave.

Segunda simulación

Cuando se interviene en procesos aleatorios en la vida real llaman mucho la atención las rachas: tener cuatro varones seguidos, sacar un seis en el parchís tres veces o que veas en la calle varios coches aparcados de la misma marca.

Simularemos experimentos de Bernouillli para descubrirlas. Como todo esto es aleatorio, nunca sabremos si aparecerán o no.

Tener cuatro varones seguidos

Ya sabes cómo se programa el simulador: como parámetro A escribiremos =1/2, que es la probabilidad aproximada de nacer varón. Luego concretaremos una sola columna para leer mejor y, por ejemplo, 200 filas. ¿Has obtenido una racha de cuatro unos (también valdría de ceros, pues tienen la misma posibilidad)?

En nuestro intento ha aparecido una racha de cuatro unos y otra de cinco muy cercana a la anterior:



Esto significa que no es un suceso tan raro. Aparecieron en 200 intentos más rachas de cuatro elementos (ceros o unos) e incluso una racha de ocho unos.

Otra forma de verlo es contar con cuatro columnas y ver si en alguna aparecen cuatro unos (con esto anticipamos la distribución binomial, que estudiaremos en su momento):



En el primer intento hemos conseguido 17 filas en las que aparecen cuatro varones. En la imagen tienes dos casos seguidos:



El último 1 de la fila resulta porque hemos añadido la función producto para contar mejor los 17 casos.

Podemos considerar que la probabilidad de que aparezcan cuatro varones es 0,54=0,0625, que multiplicado por 200 nos da el valor teórico, 12,5, por lo que nuestra simulación, con 17, no era demasiado acertada.

Tercera simulación

Recordarás la Ley de Murphy en sus distintas variantes: “Si algo puede salir mal, probablemente saldrá mal”. En efecto, a veces falla todo lo que era susceptible de fallo. Por eso, en instalaciones en las que la seguridad es prioritaria se suelen duplicar o triplicar los equipos. Imagina que en un quirófano existen tres alimentadores de energía, cada uno con una fiabilidad del 90%. ¿Podrán fallar todos a la vez?

Simularemos Bernouilli con parámetro A igual a 0,1 (probabilidad de fallo) y planificaremos tres columnas, que representarán a los tres equipos, y 1000 filas. ¿Aparecerá un fallo triple? Lo sabremos si aparece una fila con tres unos. Lo hemos intentado y logrado al primer intento:


Los que entendéis la probabilidad habréis comprendido que se  espera un fallo cada mil intentos, porque 0,1*0,1*0,1=0,001

Podéis plantearos otras simulaciones de sucesos cuya probabilidad podáis estimar y comprobar después si la simulación se acerca a las expectativas previas.