Transcription
Esta clase vamos a hacer una introducción a la estadística. Vamos a mencionar conceptos muy básicos que son los más importantes. Definitivamente, con conceptos muy grandes, usted no puede dejar de saber.
La forma en que está grabada esta clase le permite a ustedes tener la diapositiva en el momento que fuera, volver a una diapositiva previa o volver a escuchar la diapositiva que han detenido, como para que ustedes puedan comprender. Primero, para poderlo luego recordar. Una vez comprendido, es el primer propósito. El segundo es para defender de ustedes. Pero recuerden, la narración de cada diapositiva es lenta, de modo que buscamos conectar y facilitar la comprensión a lo que estamos mencionando.
Ustedes quieren que observen atentamente la diapositiva, lo que está escrito en cada una y los gráficos que se muestran. Observen atentamente ellos mientras se escucha en el audio.
La estadística se usa para poder obtener conclusiones a partir de datos que nosotros obtenemos en una determinada muestra. La muestra pueden ser los individuos en general. No pueden tener una determinada característica. Tienen un rango de edad, por ejemplo, entre 30 y 40 años. Todos deportistas, por ser todos deportistas que además tengan entre 30 y 40 años. Ser paciente que sufriera un infarto de miocardio.
Y las variables que analizamos pueden ser numéricas. A estas llamamos también cuantitativas. Por ejemplo, puede ser la edad de los pacientes. Por ejemplo, pacientes. La muestra es tuvieron un infarto. Es la muestra. ¿Qué edad tenían? Esa es la variable cuantitativa analizada. O por ejemplo, pacientes que tienen una característica común con todo. Enfermos obesos y queremos analizar sus valores de glucemia. Puede ser pacientes en un determinado rango de edad, 40 y 50 años, u otro rango. Queremos evaluar cuántas consultas médicas hacen pacientes que hacen una dieta vegetariana. Esta es la muestra y queremos analizar. Esta es la variable cuantitativa analizada: su peso, el efecto corporal.
O pueden ser variables cualitativas, o sea, no numéricas. Por ejemplo, el paciente hipercolesterolémico. Es cualitativo. Lo tiene o no lo tiene. Y por eso estudiamos si esos pacientes con o sin colesterol alto se infartan o no se infartan. También estamos evaluando variables cualitativas.
Vamos a estudiar nada más que las variables cuantitativas. Por ejemplo, tomamos una población que nosotros decimos: "Bueno, tienen que ser todos varones y tener entre 30 y 40 años y además no saberse diabéticos, que nunca les saldrá de esta". Esta es la población y queremos evaluar su glucemia. Y ahí vemos una gráfica. La abscisa se dicta el valor cuantitativo obtenido en la población que nosotros hemos seleccionado para nuestro estudio. Quizá en la ordenada, cuántas veces se repite cada valor observado en esa población o muestra.
Vemos que hay una distribución en X valores de glucemia, en la que hacia la izquierda, a la izquierda, los valores son relativamente bajos. Ponemos que sean normales, relativamente bajos, la normalidad. Pero que van aumentando hasta llegar a un registro de valores que se dan con máxima frecuencia, que eso puede ser el promedio de todos los valores de nuestra población, de todos los valores de glucemia en nuestra población. Y los valores muy bien, viniendo a la derecha, el promedio de todos los valores. Pero la distribución de los valores que están a la izquierda, eso significa menores que el promedio, que corresponde al pico del gráfico. Y los valores que están a la derecha del promedio se distribuyen. Si es estrictamente, decimos entonces que esas variables numéricas tienen una distribución normal en la población que hemos seleccionado.
Esta diapositiva vemos las variables cuantitativas. Observar que la distribución es y esas variables del dato cuantitativo es totalmente asimétrica. Cuando partimos un punto cercano a dónde nace, tanto la ordenada como la abscisa, hacia la derecha, vemos que el evento que estamos estudiando ocurre a frecuencias que alcanza su valor pico rápidamente. Y podría ser el caso de una muestra que corresponda a nuestra población. La muestra que seleccionamos: individuos que mueren en las rutas argentinas por accidente de tránsito. Y lo que estamos estudiando en la variable cuantitativa, edad que tenían esos pacientes.
La variable cuantitativa está dictada o se lista en la abscisa. Y la frecuencia con la que se da esa variable cuantitativa es la edad, la frecuencia con la que se lee esta variable realizada en la ordenada. Vemos que de todo el rango de edad máxima y mínima, mínima y máxima que tienen los pacientes que fallecieron por accidente de tránsito en las rutas argentinas, hay un claro pico que ocurre a edades relativamente tempranas de la vida, donde está el pico de nuestra curva de edades con respecto a la distribución de las edades con respecto a nuestra población. O sea, en nuestra población, es decir, la población muere en las rutas argentinas por accidente de tránsito. O sea, claramente los pacientes dentro de todo el rango etario, pacientes más jóvenes que el promedio, son los que nos marcan ahí el pico de muertos por accidente. Y a partir de esa edad, que puede ser 25 años, y más frecuentemente es a donde se registran gente muerta por accidente de tránsito de las rutas argentinas. A partir de ahí van disminuyendo lentamente. Distribuciones claramente asimétricas. Y eso es lo que nosotros hemos recogido como dato cuantitativo, edad en la abscisa, en nuestra población, corresponde a muertos de tránsito en las rutas argentinas.
Después nosotros podemos hacer la interpretación que nos parezca correcta. Podemos tirar a claro, se ve que los pacientes más jóvenes andan más rápido, a velocidades muy superiores, y estos son los que más mueren por accidente. Como podemos hacer la interpretación que nos parezca correcta. Pero el hecho es el que hicimos ahora.
Nos referimos a la medida cuantitativa de tendencia central. Existen fundamentalmente dos. Hay otra más, pero vamos a mencionar las más importantes. Una medida de tendencia central de nuestros valores cuantitativos puede ser la media. ¿Qué es la media? La media se expresa con el símbolo que hemos puesto, el fondo blanco y entre paréntesis. La media es la variable que resulta de sumar cada una de las variables cuantitativas que tenemos en nuestra población por el número de variables que estamos sumando, el tiempo, el número de casos. Es entonces el promedio de todas las variables cuantitativas.
La mediana, en cambio, es el valor cuantitativo que me separa igual número de casos mayores que su valor y menores que su valor. Vemos una distribución simétrica. La gráfica de abajo, de izquierda, simétrica de datos cuantitativos o cuantitativos que están expresados en la abscisa, en X, y la frecuencia con la que ocurren están expresados en la ordenada. En este caso, el promedio o media y la mediana van a ser muy similares, si no iguales. Si no son iguales, van a ser muy similares cuando la distribución es normal o simétrica a uno y otro lado del valor central.
Ahora nos vamos al gráfico de abajo y de la vemos claramente una distribución asimétrica de nuestros datos cuantitativos que están listados en las vistas en X y que se van dando cada uno con una frecuencia que corresponde a la frecuencia que está en la ordenada. Y en este caso, si elegimos la media, no va a coincidir para nada con el pico, sino que va a ser otra medida. Entonces, acá donde la distribución está asimétrica, y decimos la media. Agregamos entonces la otra medida que podría usarse como central, el modo. Simplemente como la moda es el valor que más se. Pero los cruzamos con la media o las medianas. Distribuciones normales o simétricas, elegimos la media. Y en distribuciones asimétricas, elegimos la media más el modo. Por lo general, no es algo que se utiliza como medidas de dispersión, es decir, valores menores o mayores que la media.
Utilizamos dos: la varianza y el desvío estándar. Hay otros, pero los más utilizados son la varianza y el. ¿Cómo calculamos la varianza? Ya que ahí me hemos representado este símbolo, se parece a un C, no es exactamente esto, es el símbolo que ustedes ven en la fórmula de la varianza a la izquierda. Antes de comenzar la descripción de cómo se calcula, vemos que tiene un superíndice 2, o sea, como si estuviera elevado al cuadrado. Se calcula como la sumatoria. La sumatoria de qué, la sumatoria de cada valor cuantitativo menos la media, y esa diferencia llevada al cuadrado. De modo que aunque sea la variable cuantitativa menos la media, un valor negativo al cuadrado se transforma en un valor mayor y siempre positivo. Se van sumando cada valor menos la media al cuadrado, todos los valores cuantitativos. Y toda esa suma se divide por el número de variables. Al dividir por el número, nos da un número que es absoluto. Es alto.
Este desvío estándar, que ahí está representado con la letra DS, se obtiene de calcular la raíz cuadrada de la varianza. Y corresponde a un número que en valores absolutos, notablemente menor que el que corresponde a la varianza.
En esta diapositiva, estos cuantitativos de una variable dispuestos simétricamente a la izquierda y a la derecha de la media, siendo entonces, como ya habíamos explicado, el promedio de todos los datos cuantitativos que hemos recogido de nuestra población. El rango de datos que tiene un valor que va de la media menos su desvío estándar hasta la media más su desvío estándar, abarca el 68% de los datos cuantitativos que extraigo de la población que estoy estudiando. Entre el rango que va desde la media a dos desvíos estándar, en más o en menos, media menos dos desvíos estándar hasta media más dos desvíos estándar, entre estos dos valores abarco el 95% de los datos cuantitativos. Y en el rango que va desde la media menos tres desvíos estándar como valor hasta la media más tres desvíos estándar, ahí se ubica el 99% de los datos con los cuales se ha armado esta curva simétrica o con disposición normal.
Disposición de los datos cuantitativos de la media a la izquierda y de la media. De modo que toda vez que el rango entre la media más menos un desvío estándar, ahí están abarcados el 68% de la población. Entre la media más menos dos desvíos estándar están ubicados el 95% de los datos cuantitativos que he extraído de la población que estoy estudiando. Entre la media más menos tres desvíos estándar de los datos cuantitativos que estoy abarcando el 99% de los datos cuantitativos y hemos extraído de la población que estamos estudiando.
Si nos dan un determinado valor, nosotros podemos ubicarlo en la curva y saber cuánto se aleja de la media. En realidad, hay métodos que lo calculan con mucha exactitud, pero nosotros acá tenemos el conocimiento conceptual, la noción conceptual de que lo podemos ubicar entre la media y un regresando a la medida estándar, entre la media y tres desvíos estándar. En la medida en que lo podemos ubicar más alejado de la media, bueno, más aleja la oportunidad de que pertenezca a nuestra población.