Covarianza y correlación
Estadística · Lección 5
Objetivo
Al terminar esta lección se puede:
- Definir la covarianza y demostrar que es un producto interno sobre las variables centradas.
- Deducir de ahí que la correlación es un coseno y que está acotada entre -1 y 1.
- Explicar por qué r = 0 no significa independencia, y dar un contraejemplo.
- Demostrar que |r| es la media geométrica de las dos pendientes de regresión.
De dónde viene
- Lección 4: la Proposición 4.8 dejó un término cruzado sin nombre en \text{Var}(X+Y). Esta lección es ese término.
- Lección 4: la varianza como esperanza de un cuadrado es el caso particular de la covarianza de una variable consigo misma.
- Matemática 4: producto interno, norma, ángulo y la desigualdad de Cauchy-Schwarz. Toda esta lección es esa lección traducida.
Para qué sirve después
- Lección 7: la matriz de covarianzas describe una normal en varias dimensiones.
- Lección 13: la pendiente de una regresión simple es \text{Cov}(x,y)/\text{Var}(x), que aquí aparece ya construida.
- Lección 15: los patrones de datos faltantes se diagnostican mirando correlaciones con la variable que indica ausencia.
- Matemática 10 y 11: el análisis de componentes principales diagonaliza precisamente la matriz de covarianzas.
- ISLP cap. 3: la multicolinealidad es correlación alta entre predictores, y de ahí que se recurra a regularización.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| X, Y | equis, i griega | Dos variables aleatorias sobre las mismas unidades |
| \mu_X, \mu_Y | mu sub equis | Sus medias poblacionales |
| \tilde{x} | equis tilde | El vector de datos centrado: x - \bar{x} |
| \text{Cov}(X,Y) | covarianza de equis e i griega | Definición 5.1 |
| \rho | rho | Correlación poblacional |
| r | erre | Correlación muestral |
| \theta | theta | Ángulo entre las dos variables centradas |
| S_{xy} | ese sub equis i griega | \sum_i (x_i - \bar{x})(y_i - \bar{y}), la suma cruzada |
| S_{xx} | ese sub equis equis | \sum_i (x_i - \bar{x})^2 |
| b_{y\mid x} | be de i griega dado equis | Pendiente de la recta que predice y a partir de x |
La tilde sobre una letra significa siempre lo mismo en este módulo: variable centrada, es decir, con su media restada. Centrar es el paso que convierte la estadística en geometría.
1. La covarianza
Definición 5.1 (covarianza). Para dos variables aleatorias con medias \mu_X y \mu_Y: \text{Cov}(X,Y) = E\big[(X - \mu_X)(Y - \mu_Y)\big]. Su versión muestral, sobre n pares observados, es \dfrac{1}{n}\sum_i (x_i - \bar{x})(y_i - \bar{y}).
El signo de cada sumando dice de qué lado del centro cae cada punto en las dos variables a la vez. Si un punto está por encima de la media en ambas, el producto es positivo; si está por encima en una y por debajo en la otra, negativo. La covarianza es el promedio de esos productos.
El visual reparte los puntos en cuatro cuadrantes alrededor del centro. Los verdes aportan positivo y los rojos negativo; la covarianza es el saldo.
En el preajuste Relación en U, los puntos siguen una parábola perfecta —conocido x, el valor de y está determinado— y sin embargo los cuadrantes se compensan y el saldo queda casi en cero. La covarianza no ve esa estructura. El apartado 4 vuelve sobre esto.
Proposición 5.2 (fórmula alternativa). \text{Cov}(X,Y) = E[XY] - \mu_X\mu_Y.
Demostración. Expandir el producto dentro de la esperanza y aplicar linealidad (Proposición 4.4), recordando que \mu_X y \mu_Y son constantes: E[(X-\mu_X)(Y-\mu_Y)] = E[XY] - \mu_X E[Y] - \mu_Y E[X] + \mu_X\mu_Y = E[XY] - \mu_X\mu_Y. \; ∎
Igual que la Proposición 4.7, es cómoda a mano y peligrosa en punto flotante, por la misma razón: resta dos cantidades grandes para obtener una pequeña.
2. La covarianza es un producto interno
Proposición 5.3. Sobre el espacio de las variables centradas, la covarianza cumple las tres propiedades que definen un producto interno:
- Simetría: \text{Cov}(X,Y) = \text{Cov}(Y,X).
- Bilinealidad: \text{Cov}(aX + bZ,\; Y) = a\,\text{Cov}(X,Y) + b\,\text{Cov}(Z,Y).
- Definida positiva: \text{Cov}(X,X) = \text{Var}(X) \ge 0, con igualdad solo si X es constante.
Demostración. (1) El producto de números reales conmuta.
Por la linealidad de la esperanza (Proposición 4.4). Si W = aX + bZ, su media es a\mu_X + b\mu_Z, de modo que W - \mu_W = a(X-\mu_X) + b(Z-\mu_Z). Multiplicando por (Y-\mu_Y) y tomando esperanza, los dos sumandos se separan.
Sustituir Y por X en la Definición 5.1 devuelve E[(X-\mu_X)^2], que es la Definición 4.5. Es no negativa por ser esperanza de un cuadrado, y solo vale cero si X - \mu_X = 0 siempre. ∎
Con eso, todo el vocabulario de la lección 4 de matemática se traduce término a término:
| En geometría (Matemática 4) | En estadística (aquí) |
|---|---|
| Producto interno u^\top v | Covarianza |
| Norma al cuadrado \|u\|^2 | Varianza |
| Norma \|u\| | Desviación estándar |
| Coseno del ángulo | Correlación |
| Vectores perpendiculares | Covarianza cero |
| Desigualdad de Cauchy-Schwarz | -1 \le r \le 1 |
3. La correlación es un coseno
Proposición 5.4 (cota de Cauchy-Schwarz). \big|\text{Cov}(X,Y)\big| \le \text{sd}(X)\,\text{sd}(Y), con igualdad si y solo si Y - \mu_Y es un múltiplo constante de X - \mu_X.
Demostración. Por la Proposición 5.3 la covarianza es un producto interno, así que la desigualdad de Cauchy-Schwarz de Matemática 4 se aplica directamente: |\langle u,v\rangle| \le \|u\|\,\|v\|. Aquí \langle\cdot,\cdot\rangle es la covarianza y \|\cdot\| es la desviación estándar, por la parte (3) de esa proposición. La condición de igualdad de Cauchy-Schwarz es que los vectores sean paralelos, que traducido es que una variable centrada sea múltiplo de la otra. ∎
Definición 5.5 (correlación de Pearson). \rho = \frac{\text{Cov}(X,Y)}{\text{sd}(X)\,\text{sd}(Y)}, \qquad\text{y en versión muestral}\qquad r = \frac{\tilde{x}^\top \tilde{y}}{\|\tilde{x}\|\,\|\tilde{y}\|} = \cos\theta.
De la Proposición 5.4 se sigue de inmediato que -1 \le \rho \le 1, y que |\rho| = 1 ocurre solo cuando los puntos caen exactamente sobre una recta.
Proposición 5.6 (invariancia afín). Para constantes a, c \neq 0 y b, d cualesquiera: \rho(aX + b,\; cY + d) = \text{signo}(ac)\cdot\rho(X,Y).
Demostración. Por la bilinealidad (Proposición 5.3, parte 2) y porque sumar una constante no cambia la variable centrada, \text{Cov}(aX+b, cY+d) = ac\,\text{Cov}(X,Y). Por la Proposición 4.6, \text{sd}(aX+b) = |a|\,\text{sd}(X) y análogamente para Y. Dividiendo, \dfrac{ac}{|a||c|} = \text{signo}(ac). ∎
La correlación no tiene unidades y no cambia al cambiar de escala. Eso la hace comparable entre variables que no comparten unidades, y al mismo tiempo significa que no informa sobre la magnitud del efecto: para eso está la pendiente, que sí las tiene.
4. Lo que la correlación no ve
Definición 5.7 (independencia). X e Y son independientes si su distribución conjunta es el producto de las marginales, es decir, si conocer una no cambia la distribución de la otra.
Proposición 5.8. Si X e Y son independientes, entonces \text{Cov}(X,Y) = 0. El recíproco es falso.
Demostración. La implicación directa usa que, para variables independientes, E[XY] = E[X]E[Y]; sustituyendo en la Proposición 5.2 se obtiene cero.
Para ver que el recíproco falla basta un contraejemplo. Sea X simétrica alrededor de cero —por ejemplo uniforme en [-1,1]— y sea Y = X^2. Entonces Y queda completamente determinada por X, así que desde luego no son independientes. Pero \text{Cov}(X, X^2) = E[X^3] - E[X]\,E[X^2] = 0 - 0\cdot E[X^2] = 0, porque todos los momentos impares de una distribución simétrica alrededor de cero son nulos. ∎
Ese contraejemplo es el preajuste Relación en U del visual anterior. La lección: r = 0 significa “sin componente lineal”, no “sin relación”.
Spearman correlaciona los rangos en vez de los valores, así que detecta cualquier relación monótona aunque sea curva. Tampoco ve la relación en U, porque esa no es monótona.
5. Las dos pendientes
Proposición 5.9. Existen dos rectas de mínimos cuadrados entre dos variables, con pendientes b_{y\mid x} = \frac{S_{xy}}{S_{xx}}, \qquad b_{x\mid y} = \frac{S_{xy}}{S_{yy}}, y su producto es r^2. Por tanto |r| = \sqrt{b_{y\mid x}\,b_{x\mid y}}: la correlación es la media geométrica de las dos pendientes.
Demostración. Las dos pendientes salen de aplicar la fórmula de mínimos cuadrados (Matemática 6) en cada dirección. Multiplicándolas: b_{y\mid x}\cdot b_{x\mid y} = \frac{S_{xy}}{S_{xx}}\cdot\frac{S_{xy}}{S_{yy}} = \frac{S_{xy}^2}{S_{xx}S_{yy}} = \left(\frac{S_{xy}}{\sqrt{S_{xx}S_{yy}}}\right)^{2} = r^2, donde el último paso es la Definición 5.5 en versión muestral. ∎
Como r^2 \le 1, las dos rectas solo coinciden cuando |r| = 1. En cualquier otro caso forman una tijera alrededor del centroide, y el ángulo de esa tijera crece al bajar la correlación. Ese es el fenómeno de regresión a la media: predecir encoge hacia el promedio, y lo hace en las dos direcciones a la vez.
6. Cuatro nubes, un solo número
Los cuatro conjuntos que Anscombe construyó en 1973. Al cambiar entre ellos conviene mirar los números, no los puntos: media, varianza, correlación y recta ajustada coinciden hasta dos decimales.
Solo el primero cumple los supuestos de una regresión lineal. El segundo es una parábola, el tercero son diez puntos alineados más un valor atípico, y en el cuarto la pendiente entera la decide una sola observación. Los estadísticos resumen, y resumir es perder información: ninguno de esos cuatro números habría revelado lo que la imagen muestra de inmediato.
Ejercicios
Ejercicio 1 — Correlación desde el producto interno
Implementar la Definición 5.5 sin usar np.corrcoef ni np.cov.
Es el coseno del ángulo entre xc y yc: el producto interno xc @ yc dividido entre el producto de las normas, np.linalg.norm(xc) * np.linalg.norm(yc).
Ejercicio 2 — La media geométrica de las pendientes
Comprobar la Proposición 5.9 y devolver la diferencia absoluta entre los dos lados de la igualdad.
b_{y\mid x} = S_{xy}/S_{xx} y b_{x\mid y} = S_{xy}/S_{yy}. Con los vectores ya centrados, S_{xy} es xc @ yc, S_{xx} es xc @ xc y S_{yy} es yc @ yc.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 05:
- Escribir
matriz_corr(X)para una matriz de datos, sin usarnp.corrcoef: centrar las columnas, normalizarlas a longitud 1 y devolver Z^\top Z. Verificar contra NumPy a 10^{-12} y explicar, usando que es una matriz de Gram, por qué toda matriz de correlación es semidefinida positiva. - Construir un cuarteto propio: cuatro conjuntos de 15 puntos con la misma media, la misma varianza y r \approx 0.7, pero de formas distintas —lineal, curva, con atípico, agrupada—. Requiere optimización o prueba y error documentada. Graficarlos en una rejilla de 2×2.
- Tomar un conjunto de datos público con varias variables numéricas y calcular Pearson y Spearman para cada par. Encontrar al menos un par donde difieran mucho y explicar qué forma lo causa. Ese contraste es el primer diagnóstico que conviene correr antes de dar por buena cualquier matriz de correlación.
Del libro
Think Stats se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.
Correlation does not imply causation.
Downey, Think Stats 3e, §7.6 Correlation and Causation
El apartado desarrolla el porqué: una misma correlación entre A y B es compatible con que A cause B, con que B cause A, y con que una tercera variable cause las dos. Los datos observacionales no distinguen entre esas tres explicaciones; hace falta un diseño experimental o los métodos del módulo de inferencia causal.
Preguntas para leer §7 con lápiz:
- §7.6 se titula Correlation and Causation. ¿Qué tres explicaciones causales distintas dice Downey que son compatibles con una misma correlación?
- §7.5 Rank Correlation compara Spearman con Pearson usando datos de ingresos. ¿Por qué difieren en ese caso concreto?
- §7.2 introduce los decile plots. ¿Qué muestran que un diagrama de dispersión no muestra, y cuándo conviene usarlos?
Para el Cerebro
Nota nueva en 10-Conceptos/covarianza-correlacion.md, enlazada a [[producto-interno]], [[esperanza-varianza]] y [[minimos-cuadrados]]. Escribir con las propias palabras el puente completo: producto interno → covarianza; norma → desviación; coseno → correlación; Cauchy-Schwarz → |r| \le 1. En 50-Errores/: r = 0 no es independencia.
¿Qué es la covarianza?::La esperanza del producto de las desviaciones: E[(X−μₓ)(Y−μᵧ)]
¿Qué es la covarianza, geométricamente?::El producto interno de las dos variables centradas
¿Qué es la varianza en ese lenguaje?::La norma al cuadrado del vector centrado, es decir Cov(X,X)
¿Qué tres propiedades hacen de la covarianza un producto interno?::Simetría, bilinealidad y definida positiva
¿Qué es la correlación de Pearson?::El coseno del ángulo entre las dos variables centradas
¿De dónde sale que −1 ≤ r ≤ 1?::De Cauchy-Schwarz aplicada a los vectores centrados
¿Cuándo vale |r| = 1?::Solo si una variable centrada es múltiplo constante de la otra, es decir, si los puntos están sobre una recta
¿Cambia r al cambiar de unidades?::No: es invariante a transformaciones afines, salvo el signo
¿Qué NO informa la correlación?::La magnitud del efecto: para eso está la pendiente, que sí tiene unidades
¿Implica covarianza cero que haya independencia?::No. La independencia implica covarianza cero, pero no al revés
¿Cuál es el contraejemplo estándar?::Y = X² con X simétrica alrededor de cero: dependencia total y covarianza nula
¿Cuántas rectas de regresión hay entre dos variables?::Dos, y solo coinciden si |r| = 1
¿Qué relación hay entre r y las dos pendientes?::|r| es su media geométrica: r² = b(y|x)·b(x|y)
¿Qué mide Spearman que Pearson no?::La monotonía, porque correlaciona los rangos en vez de los valores
¿Qué demuestra el cuarteto de Anscombe?::Que cuatro nubes de forma muy distinta pueden compartir media, varianza, r y recta ajustada
Fuentes
Lo que esta página demuestra sola. El saldo de productos cruzados del primer visual, los estadísticos idénticos de los cuatro conjuntos de Anscombe, las tres rutas al mismo r y la identidad de la Proposición 5.9 se calculan en el navegador al abrir la página.
Lo que viene de los libros.
- Think Stats 3e (Downey, CC BY-NC-SA 4.0), §7 Relationships between Variables — citado textualmente arriba.
- Mathematics for Machine Learning (Deisenroth, Faisal & Ong, CUP 2020), §6.4 Summary Statistics and Independence — referencia a nivel de sección, sin cita textual.
- Anscombe, F. J. (1973). Graphs in Statistical Analysis. The American Statistician 27(1):17–21.
Lo que es mío, no del libro. Think Stats §7 no trata la covarianza como concepto aparte: pasa directamente a la correlación. El puente con el producto interno de Matemática 4, la tabla de traducción del apartado 2 y la Proposición 5.9 con su demostración son de esta lección: correctos y derivados aquí, pero no formulados así en esos capítulos.
Índices verificados el 12-09-2026 contra el índice publicado de cada libro.
→ Siguiente: Teorema central del límite