
En este curso vamos a emplear exclusivamente una herramienta: R. R es un software estadístico gratuito y libre, con, literalmente, miles de análisis estadísticos (Vídeo 1.2). Está publicado con licencia GPL (GNU General Public License). Es muy probable que alguno de ustedes ya hayan realizado algún cálculo en R, o hayan aprendido cómo utilizar los elementos básicos de R. Y estarán de acuerdo en que su uso puede llegar a tremendamente complicado, requiriendo una curva de aprendizaje tan elevada que pocos son capaces de sobrepasar. Equivocarse en un mero signo de puntuación implica dar al traste con el análisis en cuestión. Es más, en muchas ocasiones localizar dónde está el error puede implicar la inversión de mucho, mucho tiempo. Pues bien, para evitarnos este problema y hacer que vuestra experiencia con R sea lo más gratificante, amena e instructiva posible, incluyendo una curva de aprendizaje en la que estaré a vuestro lado, vamos a recurrir al uso de R Commander.
R Commander es una interfaz gráfica de R programada en lenguaje Java. Al igual que R, es gratuito y libre, publicado con licencia GPL. Es decir, los análisis estadísticos más comunes, tanto univariantes como multivariantes, así como cálculo de probabilidades y representaciones gráficas se encuentran disponibles en menús contextuales bien estructurados y organizados.
El carácter de gratuidad del software, unido a su altísima potencialidad y rendimiento, ha hecho que en los últimos años su uso se haya ampliado muy significativamente en la comunidad científica. Hasta tal punto llega su difusión, que la prestigiosa editorial científica Springer tiene una serie de libros dedicados exclusivamente a R y su aplicación a multitud de campos, conocida bajo el nombre de Use R!.
Una vez que se inicia R Commander, aparecen varias secciones o módulos en su interfaz gráfica, que pasaremos a describir a continuación.
Es la barra de menús donde estás las opciones básicas y estadísticas de R Commander.
Muestra el conjunto de datos con el que se esté trabajando, dando la posibilidad de editarlos y visualizarlos. Asimismo, si se ha hecho algún modelo estadístico, aparecería referenciado a la derecha con su nombre.
En esta ventana (R Script), se muestran los comandos que serán ejecutados en R Commander. Si los análisis estadísticos y de otra índole los hacemos gráficamente mediante los menús del punto (1), en esta sección se verán los códigos que se ejecutan para realizar la función que estemos demandando. Pero presenta también la ventaja de que podemos incluir en esta sección el código que deseemos y modificarlo plenamente antes de su ejecución.
En Salida (Output), se verá el resultado de la ejecución de los comandos y códigos del punto (3).
En esta zona de mensajes se anuncian si se produce algún error en la ejecución de los códigos y comandos, aquí aparecerían dichos errores. También se muestran la carga de paquetes o librerías.
El objetivo principal de la Estadística Descriptiva es la de ordenar, resumir y clasificar los datos con el objetivo de tener una visión más precisa y global de las observaciones. De este modo, se pueden descubrir visualmente posibles relaciones entre los datos, ver sus puntos en común y sus diferencias, etc.
Pero otro punto importante de la Estadística Descriptiva es la de mostrar los datos de tal forma que permitan al investigador sugerir o proponer ciertas cuestiones para tratarlas posteriormente con mayor profundidad, así como determinar algunas suposiciones que son necesarias para poder realizar análisis estadísticos más complejos.
Entre los gráficos de las variables cualitativas podemos encontrar los diagramas de sectores y los diagramas de rectángulos.
Los datos de variables cuantitativas pueden representarse dependiendo de si se encuentran agrupados en intervalos o no. Debido a que la representación de datos agrupados en intervalos es raro y exótico en Estadística, no lo estudiaremos en el presente curso.
Sin embargo, es mucho más común y normal representar gráficamente los datos de variables cuantitativas que no están agrupadas en intervalos. Los gráficos principales son el Diagrama de barras (si son pocos los valores distintos) o el Histograma (si son muchos valores distintos).
En este caso representaremos uno de los diagramas más conocidos en la estadística: el diagrama de dispersión (o Scatterplot en inglés). En él, 2 variables se enfrentan, una representada en el eje X (eje abscisas) y otro en el eje Y (eje de ordenadas).
ggplot2 nos permite profesionalizar las figuras que representan datos bidimensionales, unidimensionales, etc. Aquí os mostramos unos ejemplos, como realizar áreas de densidad.
Para representar gráficamente datos tridimensionales en R es necesario instalar unos paquetes extras. En esta sección vamos a aprender a representarlos usando dos paquetes: scatterplot3d y rgl. Y como ejemplo, vamos a representar en 3Ddiagramas de dispersión compuestos por 3 variables. La ventaja del segundo respecto al primero es que es interactivo, es decir, puedes desplazar con el ratón el cubo generado para buscar la mejor visualización de los datos, mientras que en el primero tienes que indicarle los grados desde donde ver tus datos. Independientemente, ambos son una buena herramienta para ver en 3D la distribución de nuestros datos.
Al margen de las figuras y gráficos estudiados anteriormente, también es posible representar numéricamente información útil mediante números. Estos números resumen un conjunto de datos. En conjunto se conocen como promedios, medidas de posición o medidas de tendencia central. Entre otros, algunas medidas de tendencia central son la media aritmética, la mediana, la moda y los cuantiles.
Ahora bien, ¿están muy concentrados los datos en torno a esa media? O por el contrario… ¿están muy separados o dispersos?
Pues bien, para responder a estas preguntas tenemos las medidas de dispersión. El objetivo de las medidas de dispersión es, por tanto, el de estudiar lo concentrados que están los datos en torno a un promedio. Cuanto más bajo sea el valor de dispersión, más concentrados estarán en torno a la media. Entre otros, algunas medidas de dispersión son la varianza y la desviación típica.
Cualquier figura en R puede modificarse completamente. En este Anexo os muestro cómo modificar el tipo de línea (lty), el grosor (lwd), los intervalos numéricos (xlim e ylim), los colores, los títulos y subtítulos, y los iconos (pch y cex).
La situación que tiene normalmente un investigador es el de analizar una determinada variable X en los individuos de una población, o los restos arqueológicos de una cultura concreta, etc. Esta variable puede ser unidimensional (como por ejemplo, la materia prima de las herramientas líticas) o multidimensional (la materia prima, la longitud de los bordes cortantes, etc).
Entrando un poco más en detalle, el investigador tendrá el propósito de estudiar algún parámetro de sus variables de estudio, como la media, intentando inferir el valor del parámetro poblacional, construir un intervalo de confianza para dicho parámetro o tratando de decidir entre dos o más conjuntos de posibles valores mediante un contraste de hipótesis.
En esta sección aprenderemos cuáles son los modelos más comunes de distribución de los datos. He de mencionar que modelos probabilísticos y distribuciones de probabilidad son conceptos sinónimos, y pueden ser empleados indistintamente. Y además, son muy importantes porque permiten calcular, como llevan incorporado en sus nombres, probabilidades.
La buena noticia es que en R Commander no habrá que introducir ningún comando ni función manualmente, ya que todo se ejecuta a través de la interfaz gráfica de un modo muy sencillo. Pero consideramos interesante hacer alusión a ellas para tener una idea de qué cuatro funciones pueden aplicarse a cada tipo de modelo probabilístico.
La Distribución Normal muestra una distribución de los datos que tiene una forma de campana, también conocida como campana de Gauss o campana gaussiana. Estos datos proceden de una variable cuantitativa continua. Además, es una de las distribuciones más comunes porque una grandísima cantidad de fenómenos naturales se comportan siguiendo este modelo.
Algunas de las características principales de la distribución normal son:
La media se encuentra justo en la mitad de la campana. Digámoslo de otro modo, el valor de la media divide la campana en dos mitades iguales o simétricas.
La mediana y la moda coinciden en su posición con la media.
La mayoría de las observaciones se encuentran alrededor de la media.
Los contrastes de hipótesis se conocen en algunas ocasiones como tests de significación. Y son el comienzo en este curso de uno de los apartados más emocionantes y aplicados de la Estadística: la Estadística inferencial. Aquí no nos ceñiremos exclusivamente a describir los datos, bien sea numérica o gráficamente, sino que podremos hacer predicciones y comparaciones entre variables, para determinar si sus medias, por ejemplo, se corresponden con un mismo grupo o pertenecen a grupos diferentes. Es más, también podremos saber si los datos de nuestra variable provienen o no de una distribución normal. Aquí es donde radica uno de los mayores potenciales de la Estadística.
El contraste de hipótesis es el método estadístico que intenta confirmar o rechazar un supuesto sobre una población usando los datos de una muestra. Esto lleva asociado la expresión hipótesis estadística, que se refiere a una gran cantidad de supuestos que se plantean con la intención de encontrar evidencia estadística que lo apoye o rechace.
En conjunto, estos contrastes de hipótesis ocupan el núcleo central de una de las ramas principales de la Estadística: la Estadística inferencial.
Este módulo es uno de los centrales del curso. Y su objetivo fundamental es el de ofrecer de modo estructurado y organizado una gran cantidad de test estadísticos relacionados con la comparación de la media de dos o más muestras y/o poblaciones. Es decir, estos test buscan comparar dos o más poblaciones para ver si son estadísticamente diferentes o no.
A pesar de lo que pudiera parecer, la comparación de poblaciones en R es muy sencilla a través del uso de la interfaz gráfica R Commander. Comencemos por ver una de las figuras más importantes de todo el curso de Estadística aplicada para arqueólogos (explicada en este vídeo).
Cuando todas las muestras cumplen la normalidad de los datos, estamos ante la estadística paramétrica. Dependiendo del número de muestras que estemos comparando, realizaremos unos test u otros (Figura 1):
Muestras pequeñas
Varianzas iguales
t de Student
Muestras pareadas
Muestras independientes
Varianzas distintas
Test de Welch
Muestras grandes
Test basados en la normal
Muestras pequeñas
Varianzas iguales
ANOVA
Varianzas distintas
Test de Welch
Muestras grandes
Test de Welch
Cuando no se cumple la suposición de normalidad, hay que recurrir a los test no paramétricos. Según el número de poblaciones a comparar tenemos (Figura 1):
2 muestras
Wilcoxon-Mann-Whitney
Más de 2 muestras
Test Kruskal-Wallis
El Análisis de la Varianza (ANOVA) es un test estadístico que permite comparar la media de una o más variables en más de dos muestras. Dependiendo del número de variables que contenga, puede realizarse un ANOVA de un factor (1 variable) o un ANOVA de dos factores (2 variables). Para familiarizarse con la escritura anglosajona, estos tests se conocen como One-way ANOVA o Two-way ANOVA. Nosotros vamos a dar un ejemplo de un test ANOVA de 1 factor o unifactorial.
Cualquier tipo de ANOVA requiere exclusivamente 1 variable cuantitativa (por ejemplo la longitud del fémur) y una o varias cualitativas, categóricas o factoriales (por ejemplo, comunidad autónoma, clase social, profesión, etc.). Un ANOVA de un factor sería la longitud del fémur según clases sociales; un ANOVA de dos factores sería la longitud del fémur según clases sociales y profesión. Y así sucesivamente.
El objetivo de realizar un análisis de regresión y correlación es estudiar la relación existente entre dos variables aleatorias. Una de ellas se denomina variable independiente (o covariable), y es la que está sujeta a control del experimentador y se representa en el eje de abscisas como X. La otra se denomina variable dependiente y su valor depende del que tome la variable independiente, representándose en el eje de ordenadas como Y.
Es decir, con la Regresión Lineal analizamos si una variable cuantitativa Y puede ser explicada por una o más covariables cuantitativas (X1, X2… Xn)
Aunque es usual que haya cierta confusión en relación a lo que estudia un análisis de regresión y un análisis de correlación, ambos ofrecen información complementaria pero diferente. El Análisis de Regresión estudia la forma en que ambas variables aleatorias están relacionadas, mientras que el Análisis de Correlación investiga la fuerza de dicha relación.
En este módulo vamos a hacer especial incidencia en la regresión lineal simple, aunque mostraremos brevemente la regresión lineal múltiple y otros tipos de regresiones no lineales.
La Regresión Lineal Simple viene del planteamiento en la que existen dos variables aleatorias (X e Y) que están relacionadas bajo la fórmula siguiente. Los 2 parámetros β se denominan coeficientes de regresión.
Los fundamentos teóricos para comprender una regresión polinomial son los mismos que los descritos en la regresión lineal simple. La única diferencia aquí son las ecuaciones. Al ser una regresión polinomial, la ecuación deberá ser polinómica de dos grados (cuadrática), de tres grados (cúbica), de cuatro grados, etc.
Una de las funcionalidades de la generación de las ecuaciones de regresión es la de predecir los valores que tendrá la variable dependiente (Y) para un valor dado de la variable independiente (X). Con sustituir simplemente el valor de X en la ecuación obtendremos su correspondiente valor de Y.
A día de hoy no es posible predecir estos valores usando la interfaz gráfica con menús y submenús de R Commander. Tendremos que recurrir a comandos. Pero son muy sencillos y os lo explicaré en detalle para que sea una cuestión fácil de realizar por todos vosotros.
Supongamos que queremos averiguar en este caso cuánto valdría el diámetro mesiodistal (MD.mm) cuando el valor del diámetro bucolingual (BL.mm) es 10.25 mm. Es más, queremos también que nos dé el intervalo de confianza (con distintos niveles de significación) y el intervalo de predicción.
El objetivo del Análisis de Conglomerados o Análisis Cluster (en terminología anglosajona) es el de formar grupos con los que se puedan clasificar las observaciones. En este Módulo mantendremos el nombre de Análisis cluster, ya que es mundialmente conocido de este modo y además también está incorporado en el ambiente estadístico en castellano. Con este análisis se busca observar que los datos de los grupos identificados sean los más similares posibles, mientras que los grupos como tal sean lo más diferentes posibles. De este modo, a partir de un simple vistazo somos capaces de identificar y comprender los datos que proceden de entornos multivariantes.
El análisis cluster es un procedimiento analítico robusto, puesto que no asume la normalidad ni la homocedasticidad de los datos, y puede ser utilizado tanto para variables cuantitativas como cualitativas.
En el análisis cluster de casos se agrupan los individuos observados que han generado la matriz de datos inicial. El análisis cluster de casos es uno de los análisis cluster más comunes. Su principal objetivo es el de agrupar objetos basados en sus características, por lo que se considera al análisis cluster como una técnica multivariante de clasificación.
Este análisis cluster se hace secuencialmente. En una primera fase se considera cada dato como un cluster separado, en una segunda fase se agrupan los cluster generados en la primera. Así hasta generar un cluster que agrupe a la totalidad de los datos. Se construyen por tanto para que los objetos dentro de un cluster tenga más similitudes que los objetos de otros clusters. El tipo de agrupamiento que determina dichos cluster puede ser diferente y se especifican en un apartado posterior. Una vez hecho el cluster, se representa gráficamente mediante un dendrograma.
Dependiendo del análisis cluster que estemos realizando y del problema en cuestión, tendremos que seleccionar entre varios tipos de distancias entre individuos (con la que se realizará el proceso de agrupamiento que originará la matriz de distancias) y posteriormente tendremos que seleccionar el tipo de agrupamiento.
En la sección anterior hemos visto y aprendido cómo realizar un análisis cluster de casos, representando gráficamente los dendrogramas según las funciones predeterminadas que ofrece R Commander. Pero hay muchísimas más posibilidades que no son accesibles desde los menús de nuestra interfaz gráfica. Y ello requiere que modifiquemos código. Pero estaros tranquilos, aquí os explicaré paso a paso cómo conseguir personalizar dendrogramas satisfactoriamente a través del código. Vamos a por ello.
El Análisis Discriminante es un análisis estadístico que permite clasificar n individuos en g grupos previamente especificados. Es decir, a partir de un conjunto variables medidas sobre un determinado número de individuos, de los que previamente sabemos que pertenecen a dos o más grupos, se obtienen una o varias funciones que permiten clasificar a cada individuo en un grupo determinado.
Este análisis tiene una importante función, y es la predictiva, ya que permite predecir a qué grupo pertenecerían otros individuos que no fueron usados para el desarrollo de la función discriminante.
Muestra de adiestramiento (training sample): lo conforman los datos que conocemos de antemano a qué grupo pertenecen. Con estos datos se generan la/s función/es discriminante/s.
Muestra experimental (test sample): lo conforman los datos de los que no conocemos a qué grupo pertenecen pero queremos predecir cuál sería usando la función discriminante generada por la muestra de adiestramiento.
Una vez hecha esta breve introducción teórica y determinado qué es una muestra de adiestramiento y experimental, veremos un ejemplo práctico para fijar los conceptos y ver cómo se soluciona usando R Commander.
A pesar de esta aparente complejidad en su definición, realizar un análisis discriminante en R es muy sencillo a partir del uso de la función lda contenida en el paquete MASS.
El Análisis de Componentes Principales (ACP, o de sus siglas en inglés PCA, Principal Component Analysis) consiste en generar nuevas variables que sean resultado de combinanciones lineales de las originales, consiguiendo agrupar la mayor variación posible reduciendo su número. La primera componente agrupa la mayor parte de variación, la segunda algo menos, y así sucesivamente. De esta forma, en vez de tener muchas variables tenemos solo unas pocas que agrupan la mayor parte de la variación observada. Soy consciente que esta descripción en texto es relativamente complicada de entender. Por lo que haremos un ejemplo práctico en el que iremos introduciendo teoría e interpretación de resultados.
Pero primero, es necesario mencionar que el PCA no necesita ninguna asunción estadística previa, por lo que no es estrictamente necesario testear su normalidad. Sin embargo, a menudo los resultados son más útiles para datos que presentan distribución normal multivariante. Las variables tienen que ser cuantitativas.
Si observamos detenidamente la figura del vídeo de la Clase 22 nos daremos cuenta que es bastante, permítanme la expresión, “simplona”. Es informativa, sí, pero es poco atractiva. Y representar gráficamente datos estadísticos de un modo atractivo hace que el lector “lo vea” con otros ojos. Somos así los humanos, primates visuales.
El Análisis de Correspondencias se usa para representar posibles asociaciones entre variables categóricas (factores) para determinar si existe algún patrón entre ellos. Es un análisis básicamente exploratorio. A lo largo de la historia ha recibido numerosos nombres, que, a pesar de la disparidad entre ellos, todos se refieren a lo mismo. Estos eson algunos sinónimos que podéis leer en la literatura especializada: (1) análisis de componentes principales para datos cualitativos, (2) escalado óptimo, análisis, canónico, (3) método de los promedio recíprocos, (4) puntuaciones aditivas, (5) puntuaciones apropiadas, (6) ponderaciones de Guttman, (7) teoría de cuentificación de Hayashi, (8) regresión lineal simultánea, (9) análisis factorial de correspondencias, (10) biplot, (11) escalado dual.
El análisis de correspondencias bivariante en R es muy sencillo de realizar a partir del paquete ca, como veremos a continuación.
R es un lenguaje de programación, y como tal, tenemos que conocer su gramática para poder realizar los análisis estadísticos que necesitemos. Eso requiere una curva de aprendizaje relativamente elevada, que puede asustar a muchos en un inicio. Sin embargo, se ha desarrollado una interfaz gráfica que nos facilita enormemente la vida. Esta interfaz se llama R Commander, y tiene implementado en un conjunto de menús gráficos la mayoría de los análisis estadísticos más comunes. De este modo, no necesitaremos conocer la programación de base, ya que esta interfaz lo hace por nosotros.
En este curso os enseño cómo realizar estos análisis en R Commander, tales como el análisis de componentes principales, análisis cluster, estadística descriptiva, realizar regresiones, generar gráficos visualmente muy atractivos, etc.
Sin embargo, también os enseñaré un poquito de programación, para extender las funcionalidades de R Commander. Así, os enseñaré a personalizar figuras y gráficos para que sean profesionales, aprenderemos a realizar análisis de correspondencias y discriminante...
Pero no nos centraremos solo en la interfaz, puesto que una de las mayores ventajas de R Commander es que cada cosa que hagamos con su interfaz, podremos ver el código de R que se ha ejecutado. De este modo, aprenderemos a posteriori programación, casi sin quererlo.