📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

MEDIDAS DE DISPERSIÓN (D. MEDIA, VARIANZA, D. TÍPICA, COEFICIENTE DE VARIACIÓN) - DATOS AGRUPADOS

IngE Darwin26:03

Transcription

Qué tal amigos, sean bienvenidos a un vídeo más. Continuamos con el curso de estadística y el día de hoy vamos a estudiar las medidas de dispersión para datos agrupados.

Bien, las medidas de dispersión son parámetros que miden la separación de los datos de una distribución respecto a su media. Dentro de dichas medidas tenemos el rango, representado con la letra R mayúscula. Se calcula como la diferencia entre el límite superior del último intervalo y el límite inferior del primer intervalo, y la fórmula puede quedar expresada de la siguiente manera: el dato máximo menos el dato mínimo de nuestra distribución.

Otra medida de dispersión es la desviación media, simbolizada con $D_x$. La desviación media es la media aritmética de los valores absolutos de las desviaciones respecto a la media, y aquí tenemos la fórmula, donde $x_i$ es la marca de clase de cada intervalo, $\bar{x}$ es la media aritmética o promedio, $f_i$ la frecuencia absoluta de cada intervalo y $n$ es el número total de datos. Cuando resolvamos el ejercicio, explicaremos cómo se utilizan las distintas fórmulas.

Ahora tenemos la varianza. Para este caso, se puede simbolizar de dos maneras: si se trata de una población, el símbolo es $\sigma^2$, y si se trata de una muestra, el símbolo es $s^2$. La varianza es la media aritmética de los cuadrados de las desviaciones respecto de la media de una distribución estadística. Para este caso, tenemos dos fórmulas. Podemos utilizar cualquiera de las dos, al final saldrá el mismo resultado, pero en el ejercicio del día de hoy utilizaremos la primera fórmula. También hay que tomar en cuenta que si se trabaja como una muestra, en lugar de $\sigma$ ubicaremos la letra $s$, y asimismo al valor de $n$ se le debe restar 1. Tenemos aquí los distintos parámetros de la fórmula: $x_i$ es la marca de clase de cada intervalo, $\bar{x}$ lo tenemos también la media aritmética o promedio, $f_i$ que es la frecuencia absoluta de cada intervalo y $n$ que es el número total de datos.

Ahora tenemos la desviación típica o estándar. Al igual que la varianza, también se le puede simbolizar de dos formas: si se trabaja con una población será $\sigma$, y si se trabaja con una muestra será $s$. La desviación típica es la raíz cuadrada de la varianza, y también tenemos dos fórmulas para poder calcular la desviación típica. En ambos casos, el resultado es el mismo, pero vamos a utilizar para el ejercicio la primera fórmula. Y si trabajamos con una muestra, en lugar de $\sigma$ ubicaremos la letra $s$, y asimismo a $n$ se le debe restar 1. Tenemos aquí los parámetros de las fórmulas, donde $x_i$ es la marca de clase para cada intervalo, $\bar{x}$ tenemos la media aritmética o promedio, $f_i$ y la frecuencia absoluta de cada intervalo, $n$ el número total de datos.

Y finalmente tenemos el coeficiente de variación, simbolizado como $CV$. Es la relación entre la desviación típica de una muestra y su media. El coeficiente de variación se suele expresar también en porcentaje. Tenemos aquí la fórmula, donde $\sigma$ o $s$ es la desviación típica o estándar, y $\bar{x}$ también tenemos la media aritmética o promedio. Si deseamos expresar en porcentaje, deberemos multiplicar al resultado de esta división por el 100%.

Estas son las medidas de dispersión y ahora vamos a utilizarlas en nuestro ejercicio. Entonces, tenemos ya el enunciado del ejercicio, el mismo que menciona que se tienen los datos correspondientes a la muestra de las edades de un grupo de pacientes que asisten a un consultorio médico durante un mes. Este mismo ejercicio utilizamos en vídeos anteriores para encontrar la tabla de frecuencias y las medidas de centralización, así que les recomiendo que observen dichos vídeos para que el tema del día de hoy quede más claro.

Bien, tenemos aquí ya organizada una tabla para encontrar los distintos parámetros y poder calcular las medidas de dispersión. En la primera columna tenemos los intervalos correspondientes a la edad en años de los pacientes. Tenemos la segunda columna con $x_i$, que es la marca de clase, y la tercera columna con $f_i$, que es la frecuencia absoluta. Con estas tres columnas ya podemos encontrar los distintos parámetros. Les recuerdo brevemente que para encontrar la columna de $x_i$ se debe sumar el límite inferior y el límite superior de cada intervalo y dividir entre 2. 20 más 30, 50 dividido entre 2, 25. Realizamos el mismo proceso para todos los intervalos y así obtenemos $x_i$, que es la marca de clase. Tenemos $f_i$, que no es nada más que el número de datos en cada intervalo, y si sumamos los $f_i$ tendremos un resultado de $n$. $n$, recordemos que es el total de pacientes para nuestro estudio estadístico, dando un resultado de 200. 200 pacientes.

Entonces, empecemos con los cálculos. A pesar de que en el anterior de medidas de centralización ya se encontró esta columna que corresponde a $x_i \cdot f_i$, vamos a volver a realizar dichos cálculos. Entonces, empecemos para poder encontrar esta columna. Empezamos a multiplicar $x_i$ por $f_i$, es decir, la marca de clase por la frecuencia absoluta. 25 por 20 me da un valor de 500, y ubicamos. 35 por 35, 1225. 45 por 50, 2250. 55 por 49, 2690. 65 por 25, 1625. 75 por 15, 1125. Y finalmente, 85 por 6, 510.

Hemos obtenido el producto de $x_i \cdot f_i$ para cada intervalo. Ahora vamos a realizar la suma de todos estos valores. Al sumar todos estos valores, tenemos un resultado de 91930. Este parámetro es importante, ya que nos permite obtener el promedio. Entonces, calculamos el promedio, que viene representado como la letra $\bar{x}$. Esto es igual, y si recordamos la fórmula, es la sumatoria de $x_i \cdot f_i$ sobre el valor de $n$. Vamos a reemplazar la sumatoria de $x_i \cdot f_i$, ya la acabamos de obtener y corresponde a 91930. Esto sobre $n$, $n$ es el total de datos que tenemos, que es 200. Si realizamos esta división, tenemos un valor de 49.65.

Bien, una vez que tenemos el promedio, vamos a utilizar este valor para obtener el resto de columnas de la siguiente manera. Vamos con la columna de $|x_i - \bar{x}|$. Recordemos que al realizar la resta entre estos dos parámetros, deberemos obtener el valor absoluto, dando como resultado un número positivo. Ahora bien, vamos a empezar con el reemplazo. Vamos a utilizar $x_i$, es decir, esta columna, y el promedio, que es el valor que acabamos de encontrar. Empecemos: 25 menos 49.65, eso me da un valor de menos 24.65. Como hablamos de valor absoluto, vamos a ubicar como valor positivo, quedando 24.65. Vamos ahora con el siguiente intervalo, $x_i$, que corresponde ahora a 35. 35 menos del promedio, es decir, 49.65. Restamos y nos da un resultado de menos 14.65, pero ubicamos como positivo, ya que es valor absoluto: 14.65. Ahora, 45 menos 49.65 da un resultado de menos 4.65, pero ubicamos como valor positivo: 4.65. 55 menos 49.65, esto es igual a 5.35. 65 menos 49.65 es igual a 15.35. 75 menos 49.65 es igual a 25.35. Y finalmente, 85 menos 49.65 da un resultado de 35.35. Nuevamente, recordemos que hicimos para obtener esta columna: vamos a restar $x_i$, cada uno de estos datos, menos el promedio y en el caso de que salga un valor negativo, ubicamos como positivo, ya que es valor absoluto.

Vamos ahora con la siguiente columna. En este caso, vamos a realizar una multiplicación entre $f_i$, que es la frecuencia absoluta, y la resta de $x_i$ menos el promedio. Es decir, vamos a utilizar esta columna y esta columna. Empezamos entonces a multiplicar los valores correspondientes: 20 por 24.65 da un valor de 493. 35 por 14.65 tenemos un valor de 512.75. 50 por 4.65 es 232.5. Ahora, 49 por 5.35 es 262.15. Continuamos: 25 por 15.35 es igual a 383.75. 15 por 25.35 da un resultado de 380.25. Y finalmente, 6 por 35.35, esto es igual a 212.1. Nuevamente, recordemos cómo acabamos de obtener esta columna: vamos a multiplicar $f_i$, que es la frecuencia absoluta, por la resta entre $x_i$ y el promedio.

Vamos a continuar con la siguiente columna para encontrar la diferencia de $(x_i - \bar{x})^2$. Vamos a utilizar la columna de valor absoluto, es decir, esta columna. Lo único que vamos a hacer es elevar cada uno de estos datos al cuadrado y vamos a poner aquí el resultado. Empecemos: 24.65 elevado al cuadrado da un resultado de 607.62. Vamos a utilizar dos decimales para todos los datos. Continuamos: 14.65 elevado al cuadrado es igual a 214.62. 4.65 elevado al cuadrado, esto da un resultado de 21.62. 5.35 elevado al cuadrado tenemos como resultado 28.62. Ahora, 15.35 elevado al cuadrado dando un resultado de 235.62. Continuamos: 25.35 elevado al cuadrado es igual a 642.62. Y finalmente, 35.35 elevado al cuadrado da un resultado de 1249.62.

Y finalmente, vamos a obtener la última columna. Para este caso, vamos a multiplicar esta columna con las frecuencias absolutas para obtener nuestro resultado. Empecemos: 20 por 607.62 da un resultado de 12152.4. Ahora, 35 por 214.62 da un resultado de 7511.7. 50 por 21.62 da un resultado de 1081. Seguimos: ahora tenemos 49 por 28.62 da un resultado de 1402.38. Vamos ahora a multiplicar 25 por 235.62, teniendo como resultado 5890.5. 15 por 642.62 da un resultado de 9639.3. Y finalmente, el último dato: 6 por 1249.62 da un resultado de 7497.72.

Bien, hemos acabado de obtener absolutamente toda la tabla necesaria para poder calcular las medidas de dispersión. A partir de este momento, vamos a explicar cómo se utiliza cada uno de estos datos encontrados al reemplazar en las fórmulas ya explicadas al inicio del vídeo. Comencemos con el cálculo del rango. Para esto, ya tenemos escrita aquí la fórmula, la misma que es el dato máximo menos el dato mínimo. Para encontrar estos dos valores, vamos a trabajar con la columna de los intervalos y vamos a marcar el primer intervalo y el último intervalo. Hemos marcado estos dos intervalos para tener como referencia los datos que vamos a utilizar. Del primer intervalo, vamos a seleccionar el límite inferior, es decir, 20. Marcamos. Y del último intervalo, vamos a seleccionar el límite superior, que para este caso es 90. También marcamos. Ahora vamos a reemplazar estos dos valores en la fórmula del rango. Esto es igual: para el dato máximo, corresponde en este caso al límite superior del último intervalo. Copiamos 90. La fórmula dice menos, y para el dato mínimo, nos ubicamos en cambio en el límite inferior del primer intervalo, que para este caso el valor es 20. Copiamos 20. Y es así como hemos reemplazado el dato máximo y el dato mínimo para calcular el rango. Realizamos la resta correspondiente: 90 menos 20, 70. Y bien, con esto hemos encontrado el rango de nuestra distribución. Nuevamente, les recuerdo que para encontrar este valor, trabajamos con la columna de los intervalos y utilizamos el primer intervalo y el último intervalo y realizamos el reemplazo correspondiente del límite inferior y el límite superior.

Ahora pasamos al cálculo de la desviación media. Y también tenemos descrita ya aquí la fórmula, pero vamos a analizar cuál de las columnas se utiliza para reemplazar en esta fórmula. Bien, lo primero que analizamos es el tipo de fórmula que tenemos: tenemos el valor absoluto de $|x_i - \bar{x}|$ y esto multiplicado por $f_i$. Todo este parámetro lo buscamos en nuestra tabla y corresponde a esta columna. Podemos notar que este parámetro es el mismo que la fórmula. Entonces, para encontrar la sumatoria, vamos a proceder a utilizar todos estos datos. Así que marcamos para tener como referencia los datos a utilizar. Una vez que hemos analizado qué columna utilizar, vamos a realizar la sumatoria de todos estos datos. Si sumamos estos valores, tenemos un resultado de 2476.5. Y este valor es la sumatoria para el numerador. Reemplazamos entonces en nuestra fórmula. Esto es igual, reemplazando, quedará 2476.5 sobre, y tenemos ahora que reemplazar el valor de $n$. Volvemos a nuestra tabla y sabemos que $n$ es igual a 200, a 200 pacientes. Entonces, este valor irá en el denominador. Escribimos 200. Esto es igual. Realizamos la división correspondiente y tenemos un resultado de 12.38. Y es así como hemos encontrado la desviación media para nuestros datos. Nuevamente, hacemos un breve recuento para saber qué columna utilizar: nos basamos en las expresiones que tenemos en la fórmula, buscamos entonces la columna a utilizar y realizamos la sumatoria correspondiente. Hay que tomar en cuenta que para no reemplazar tantos valores en la fórmula es que se hace uso de una tabla, debido a que es más fácil realizar los cálculos correspondientes y así evitamos cometer errores, ya que se trabaja con varios datos.

Ahora calculemos la varianza. Si recordamos la teoría, la varianza tiene dos simbologías: $\sigma$ y $s$. Eso depende si trabajamos con una población o con una muestra. Nosotros estamos trabajando en nuestro estudio estadístico con una muestra de 200 pacientes, por ende, utilizaremos la letra $s$. Tenemos aquí también ya escrita la fórmula de la varianza y vamos a realizar el reemplazo correspondiente, pero primero analicemos qué tipo de columna vamos a utilizar en nuestra fórmula. Si vemos en el numerador, tenemos una diferencia entre $x_i$ y el promedio, y todo esto elevado al cuadrado, multiplicado por $f_i$. Y busquemos entonces esta expresión en las columnas, y podemos notar que corresponde a la última columna. Esta misma expresión es la que tenemos en el numerador. Entonces, marcamos dicha columna para tener como referencia los datos que vamos a usar. Bien, hemos marcado ya la columna que vamos a utilizar, y les recuerdo que esta marcación es opcional. Yo he optado por marcar, debido a que esto les servirá para que ustedes tengan una mayor comprensión de los datos que estamos utilizando. ¿Qué vamos a hacer ahora? Vamos a sumar todos estos valores, y si sumamos, tenemos un resultado de 45017.53. Este término numérico vamos a reemplazar ya en el numerador de nuestra fórmula. Esto es igual, y copiamos 45017.53 sobre, y ahora vamos a ver qué valor ponemos en el denominador. Como estamos trabajando con una muestra, en la fórmula de la varianza debemos realizar $n-1$. $n$ para nuestro caso sigue siendo 200. A este 200 le quitamos 1 y queda 199. Ese valor ubicamos en el denominador. Entonces, nuevamente, 200 que es $n$ menos 1 es 199. Esto es igual, y tenemos un valor final de 227.01. Y bien, hemos encontrado ya el valor de la varianza. Para este caso, hemos hecho uso de la última columna, sumando todos los datos, y esto reemplazamos en nuestra fórmula.

Ahora vamos a realizar el cálculo de la desviación típica. Al igual que la varianza, utilizamos el símbolo $s$, ya que estamos trabajando con una muestra de 200 pacientes. Tenemos aquí escrita ya la fórmula, y para no complicar el proceso, lo que está dentro de la raíz, ya de calcular. Lo que está dentro de la raíz es el valor de la varianza, y hemos copiado aquí el valor de la varianza que acabamos de obtener. El valor de la varianza es igual a 227.01. A este valor debemos sacarle la raíz cuadrada para obtener la desviación típica. Entonces, reemplazamos en la fórmula. Esto es igual. Todo esto que se encuentra dentro de la raíz cuadrada equivale a este valor numérico: 227.01. Y este valor dentro de la raíz cuadrada. Esto es igual. Realizamos el cálculo correspondiente y tenemos un resultado de 15.06. Y listo, hemos encontrado el valor de la desviación típica. No es nada más que la raíz de la varianza.

Vamos a obtener el valor del coeficiente de variación. Tenemos aquí la fórmula y necesitamos los siguientes datos: por un lado, la desviación típica, que ya la acabamos de calcular, y el promedio, que calculamos al inicio para elaborar toda la tabla. Hemos escrito ya aquí esos dos parámetros y vamos a reemplazar en nuestra fórmula. Esto es igual. Tenemos la desviación típica, que hemos utilizado la letra $s$ porque estamos trabajando con una muestra, que equivale a 15.06, sobre, y copiamos ahora el valor del promedio, que en este caso es 49.65. Esto es igual a 0.303. Y hemos encontrado ya el coeficiente de variación, pero la teoría menciona que este valor también puede quedar expresado como porcentaje. Para encontrar el porcentaje, multiplicamos 0.303 por 100%, obteniendo un resultado de 30.3%. Entonces, no nos olvidemos que para encontrar el porcentaje, multiplicamos al coeficiente por 100%.

Y bien, hemos terminado de calcular todas las medidas de dispersión. Antes de finalizar, realizaremos un resumen general del tema del día de hoy. Para encontrar las medidas de dispersión, hemos utilizado una tabla que permite organizar y facilitar los cálculos. Una vez que hemos completado todas las columnas de la tabla, se debe analizar qué columna utilizar para las distintas medidas de dispersión y poder reemplazar en las fórmulas correspondientes. Con eso, ya hemos obtenido como primera medida el rango con un valor de 70. Tenemos la desviación media con un valor de 12.38. La varianza con un valor de 227.01. La desviación típica o estándar 15.06. Finalmente, el coeficiente de variación es a 0.303, y para convertir a porcentaje, multiplicamos por 100%, quedando finalmente 30.3%. Cada uno de estos valores son importantes, ya que indican el comportamiento de nuestra distribución. Por ejemplo, la desviación típica indica cuán alejados están los datos respecto al promedio. Mientras este valor es más pequeño, significa que los datos se encuentran más juntos, es decir, menos dispersos. En cambio, si este valor incrementa, significa que los datos se encuentran más dispersos respecto a la media y entre ellos. En un video posterior, realizaremos un análisis más a fondo de qué significa cada uno de estos valores.

Bien, espero que este vídeo les haya parecido interesante. Les dejo aquí los enlaces correspondientes a los temas de tabla de frecuencias y medidas de centralización para datos agrupados. Asimismo, les recuerdo que en próximos vídeos estudiaremos medidas de posición y gráficos estadísticos. Sin más, me despido y nos vemos en una próxima ocasión.

[Música]