Transcription
Hola, bienvenidos. Hoy vamos a aprender sobre el análisis de varianza. Como siempre, antes de desarrollar el ejercicio en Excel, vamos a revisar un poco de la teoría.
El análisis de varianza, o comúnmente llamado ANOVA por sus siglas en inglés, es un test básico de estadística para el estudio del efecto de uno o más factores sobre la media de una variable. Esos factores pueden tener dos o más niveles. Lo más común, lo más frecuente en donde se utiliza este test, es cuando se desea comparar las medias de dos o más grupos.
Veamos aquí en la figura de la izquierda tenemos tres muestras, cada uno con media uno. Si se dan cuenta, no existe a simple vista diferencias entre las medias. Pero si observamos las figuras de la derecha, tenemos aquí tres muestras pero con medias menos dos, uno y tres. Entonces, la intención de este test es detectar estadísticamente si existen diferencias entre el grupo A, el grupo B y el grupo C.
¿Cuáles son los supuestos que debe cumplir para realizar un análisis de varianza? Debe existir aleatoriedad de las muestras, debe haber independencia de las variables, debe existir normalidad de las distribuciones de los datos y, por último, debe existir igualdad de varianza entre los grupos.
¿Qué prueba utilizar cuando utilizamos análisis de varianza? Cuando queremos comparar tres o más grupos, muestras o poblaciones, no en el caso de datos no pares a dos o pareados, haremos ANOVA. ¿Y qué debe cumplirse? Como ya lo hemos dicho, debe existir distribución normal de los datos.
¿Cómo hacemos inferencia mediante ANOVA? Partimos de la hipótesis nula, donde nos dice que cada media, por cada promedio de los grupos, son iguales entre sí. Y cuál es la hipótesis alterna, que no todas los promedios son iguales.
Entonces, en ANOVA comúnmente se muestra mediante esta tabla, donde tenemos en la primera columna las fuentes de variación, entre las muestras o dentro de las muestras. Tenemos también la suma de los cuadrados, pueden ser de los tratamientos o las muestras y la suma de los cuadrados del error y la suma de cuadrados del total. Por aquí tendremos los grados de libertad, por acá tenemos los cuadrados medios y, finalmente, el objetivo es calcular este F, ¿no? Que es la división del cuadrado medio de los tratamientos entre el cuadrado medio del error.
¿Y cuándo rechazamos la hipótesis nula? Cuando este F calculado es mayor a un F teórico que sigue una distribución F con k menos 1 y n menos k grados de libertad. Entonces, cuando el F calculado es mayor que el F teórico, diremos que existen diferencias entre las medias de los tratamientos, de los grupos o de las poblaciones.
Y por acá, por supuesto, tenemos las fórmulas más simplificadas para poder calcular en forma manual. Posterior a que hayamos realizado la prueba de hipótesis donde concluimos que existe diferencias entre las medias, podemos hacer una comparación de parejas de medias para ver entre qué medias existen esas diferencias. Esto lo vamos a hacer mediante el método de Tukey, ¿no? Que consiste en comparar las diferencias entre medias muestrales con un valor crítico que va a estar dado por esta fórmula, donde T sub alfa es el valor de Tukey. Q sub alfa, k, n menos k, este es un valor que lo vamos a obtener de la tabla de Tukey. Y por acá vamos a tener la raíz cuadrada del cuadrado medio del error dividido entre n sub i, que son la cantidad de observaciones por cada tratamiento o por cada grupo. Entonces, se declaran significativamente diferentes los pares de medias cuya diferencia muestral en valor absoluto sea mayor a este valor calculado de Tukey.
Bien, ahora veamos un ejemplo en Excel. Aquí he creado una plantilla para que el video no sea extenso. Simplemente es configurar el Excel de tal forma que pueda tener la forma de la tabla de análisis de varianza. Para que he traído las fórmulas, la fórmula simplificada y el ejemplo está referido a que se ha investigado el efecto de cuatro métodos de ensamble, método A, B, C y D, sobre el tiempo de ensamble en minutos. La estrategia experimental es aplicar cuatro veces los cuatro métodos de ensamble en orden completamente aleatorio. Si se usa el diseño completamente al azar, se supone que además del método de ensamble, no existe ningún otro factor que influya de manera significativa sobre la variable de respuesta, que es el tiempo de ensamble. El tiempo de ensamble está expresado en minutos y por acá tenemos los tiempos para las cuatro repeticiones que se ha hecho para cada método.
Como siempre, antes de empezar, para que puedan seguir paso a paso lo que se va a desarrollar en el video, este archivo está en la descripción del video para que puedan seguirme. Bien, entonces, según la fórmula que tenemos por aquí, necesitamos la suma de los cuadrados por cada grupo y la suma total. No, acá igual necesitamos la suma de los cuadrados de cada elemento de la muestra, ya en total, y luego la suma de cuadrados del total. Entonces, empezamos con la sumatoria para cada grupo de los tiempos para cada grupo, ¿no? Entonces, sumamos simplemente con fórmulas de suma para cada columna. Ya tenemos la suma. Ahora calculamos el promedio de los tiempos para cada grupo y por aquí ya tenemos los promedios. Ahora necesitamos la suma total, simplemente vamos a sumar todos los elementos independientemente del grupo. Es la suma total, ¿no? Y luego nos pide n sub i, que en este caso es la cantidad de elementos de cada de cada grupo, de cada muestra. Entonces, para cada muestra nosotros tenemos 4 repeticiones o cuatro datos. N mayúscula es el total de elementos que comprende todas las muestras, en total son 16. Y K es el número de grupos, número de muestras que se está tratando de comparar, en este caso sería 4 también.
Ahora necesitamos calcular la suma de cuadrados del tratamiento. Vamos a utilizar esta fórmula. Observen aquí, tenemos la sumatoria desde i igual a 1 hasta K, o sea, para cada grupo. Uno dividido entre n sub i, pero aquí n sub i es común o es único para cada para cada grupo, es 4. Entonces, simplemente haremos igual, vamos a hacer 1 entre 4, vamos a sacarlo de la sumatoria y lo vamos a multiplicar por la suma de cuadrados de la sumatoria para cada muestra, ¿no? Entonces, será suma de cuadrados de las sumas de cada muestra, menos aquí nos dice es la suma total elevado al cuadrado. Entonces, vamos a utilizar potencias, potencias, abrimos paréntesis de esta suma total, potencia, entonces será elevado al cuadrado, potenciados, dividido entre N mayúscula, que en este caso es 16. Muy bien, ahí ya tenemos la suma de cuadrados del tratamiento.
Ahora vamos a calcular la suma de cuadrados del total mediante esta fórmula. Acá nos dice que la sumatoria de todos los elementos, entonces será suma, suma de cuadrados, ojo, suma de cuadrados, seleccionamos todos los elementos, menos nuevamente la suma total elevado al cuadrado. Entonces, será potencia, esta es la suma total elevado al cuadrado, dividido entre N mayúscula, que sería 16. Entonces, aquí tenemos la suma del cuadrado del total y la suma de cuadrados del error, simplemente será la suma del cuadrado del total, suma de cuadrado del total, menos la suma de cuadrados de los tratamientos. Ahí ya tenemos nuestros tres valores calculados que nos van a servir aquí en la tabla ANOVA. Por acá traemos la suma de cuadrados entre las muestras o de los tratamientos, que es lo mismo, entonces será 69.5. La suma de cuadrado dentro de las muestras o que es del error, y por aquí tenemos la suma de cuadrados del total. Muy bien.
Ahora necesitamos los grados de libertad. En este caso, entre las muestras nos dice que es K menos 1, pero sabemos que K es 4, menos 1, 3. Luego, los grados de libertad dentro de las muestras o del error será N mayúscula menos K, en este caso N mayúscula es 16, menos K que es 4, será 12. Y los grados de libertad del total será N mayúscula menos 1, sería 16 menos 1, será 15. Luego, los cuadrados medios, simplemente es la división de la suma de cuadrados entre los grados de libertad para cada uno. Simplemente hacemos esa división y ya tenemos los cuadrados medios del error y dentro de las muestras o de los tratamientos. Y luego calculamos el F, que es simplemente la división del cuadrado medio de los tratamientos entre cuadrado medio del error. Ya tenemos el F calculado.
Ahora necesitamos calcular el valor crítico. ¿Y cómo calculamos eso? Esto sería un F de la tabla, ¿no? Entonces, para lo cual vamos a utilizar una fórmula que va a ser inversa de la distribución F con cola derecha. La probabilidad, en este caso, vamos a utilizar 0.05, este sería el alfa. Los grados de libertad sería 3 y los grados de libertad 2 sería 12. Entonces, aquí tenemos el F calculado, perdón, el F teórico que sería de la tabla, y este es el punto crítico. Y esto sería el P valor. Vamos a calcular mediante una fórmula que va a ser distribución F con cola derecha X, en este caso va a ser el F que hemos calculado, los grados de libertad 1 será 3 y los grados de libertad 2 serán 12. Entonces, ya tenemos el valor de F teórico, en este caso el punto crítico y el P valor para este test.
Bien, entonces, antes de poder explicarles esta gráfica, vamos a comprobar si todo lo hecho manualmente corresponde con lo que podíamos hacer mediante el método abreviado a través del módulo de análisis de datos del Excel. Entonces, nos vamos a Datos y por aquí tenemos la opción o el módulo de análisis de datos. Pero si no lo tienen, podemos habilitarlo simplemente. Nos vamos a Archivo, Opciones, Complementos y aquí tenemos Ir y seleccionamos Herramientas para el Análisis. Le damos a Aceptar y automáticamente nos va a mostrar por aquí este módulo.
Entonces, vamos a hacer el análisis de varianza a través de este módulo. Le damos simplemente Análisis de Datos, Análisis de Varianza de un factor, Aceptar. Y el rango de entrada, en este caso, vamos a seleccionar este rango. Ya lo tenía seleccionado. Los datos están en columnas, ojo, hay que tener cuidado porque en este caso está en columnas porque los métodos están en columnas. Luego, los rótulos están en la primera fila y el rango de salida voy a seleccionar esta celda para poder comprobar dentro de esta misma hoja. Y ya tenemos por aquí calculado. Observe, el Excel nos da calculado automáticamente por aquí los valores de salida. Tenemos los grupos, tenemos la suma total, los promedios y las varianzas. Y por acá, lo más importante, tenemos la tabla de análisis de varianza. Y como pueden observar, tenemos exactamente las mismas cantidades, ¿no? La suma de cuadrados entre grupos, dentro de los grupos, los cuadrados medios y por acá el F calculado es exactamente igual a que nos está calculando la probabilidad o lo que nosotros hemos calculado como el P valor, que es exactamente igual, y el valor crítico, el F calculado aquí, ¿no?
Entonces, vamos a explicar qué significan los valores que hemos obtenido. Por aquí tenemos el valor crítico o el punto crítico, que sería el límite entre la región de aceptación y la región de rechazo en esta prueba de hipótesis, donde si nosotros tenemos un valor F calculado a la derecha del valor crítico, entonces, ¿qué nos dice la teoría? Debemos rechazar la hipótesis nula. Entonces, aquí nosotros hemos calculado 9.42. Entonces, aquí, ¿cuál sería la decisión? Se debe rechazar la hipótesis nula, ¿no? Entonces, en términos de nuestro ejercicio, nuestro ejemplo, diríamos que existe diferencias en los tiempos de ensamble entre los métodos A, B, C y D. Eso sería nuestra decisión o nuestra conclusión.
Pero sin embargo, hasta ahora sabemos, según la prueba de hipótesis aquí, que existe diferencias, pero no sabemos qué medias o cuáles son los tiempos promedios que son estadísticamente diferentes. Entonces, ahí viene el método de Tukey, que nos permite comparar pares de medias a fin de determinar si existe o no existe diferencia entre esos pares. Nuevamente, aquí tenemos la plantilla que tenemos la tabla para el método de Tukey. Vamos a utilizar los datos que hemos obtenido anteriormente. Acá, en este caso, es 4. Ya sabemos, N menos K será, en este caso, 16 y K que es 4, será 12. Cuadrado medio del error, voy a traer de la tabla que he calculado por aquí, 2.458. Ese es el cuadrado medio del error. N sub i será 4. Y este valor Q sub alfa va a ser el valor que vamos a obtener de la tabla. En este caso, K es el valor que vamos a ubicar en la columna y N menos K va a ser el valor que vamos a ubicar en la fila. Entonces, primero tenemos K que es 4 y N menos K que es 12. Entonces, la intersección por aquí tenemos 4.20. Entonces, ese valor va a ser 4.20.
Ahora, simplemente vamos a aplicar esta fórmula que va a ser igual Q sub alfa va a ser 4.2 por la raíz del cuadrado medio del error dividido entre N, que va a ser 4. Y ya sabemos que el T sub alfa es 3.29. Ahora, para poder identificar cuáles son las diferencias significativas, vamos a calcular la diferencia de los promedios para cada una de las muestras. Entonces, aquí primero vamos a calcular la diferencia de promedio de A menos el promedio de B. Y nos dice que debe ser en valor absoluto. Entonces, vamos a aplicar absoluto del promedio de A, que sería 7.3, menos el promedio de B, que sería 8.5. Luego, el promedio de A nuevamente, el valor absoluto, promedio de A menos el promedio de C. Ya ahí tenemos 5.50. Nuevamente, el valor absoluto, promedio de A menos el promedio de D, promedio de D. Y luego necesitamos restar el promedio de B menos el promedio de C, promedio de B menos el promedio de C. Luego, necesitamos restar el promedio de B, promedio de B menos el promedio de D. Y por último, el promedio de C menos el promedio de D. Entonces, por aquí ya tenemos las diferencias muestrales para cada par de muestra.
Y luego la decisión es que existe diferencias significativas o no significativas. Siempre que el valor calculado sea mayor a las diferencias muestrales, en este caso 3.29, no es mayor a 1.25, entonces esta diferencia es no significativa. Aquí sí tenemos una diferencia significativa porque 5.50 es mayor que 3.29. Creo que dije al revés al principio, disculpen. La diferencia significativa es cuando la diferencia muestral es mayor al valor de Tukey calculado. Entonces, aquí es no significativa, por aquí es significativa, no significativa y no significativa.
Bien, entonces, aquí como conclusión podemos decir que el método A es igual al método B, es igual al método D, y el método C es igual al método D. Entonces, ¿qué métodos son diferentes? El método A y C, y el método B y C. No olvides de suscribirte al canal y si les ha gustado el video, regálame un like y compartan con todos sus contactos.