La normal multivariante, y la deuda de la lección 9
Estadística · Lección 12
Objetivo
Al terminar esta lección se puede:
- Leer la densidad de una normal multivariante y decir qué papel juega cada pieza, en particular \det\Sigma.
- Demostrar que sus curvas de nivel son elipses cuyos ejes son los eigenvectores de \Sigma y cuyos semiejes miden \sqrt{\lambda}.
- Demostrar que bajo normalidad conjunta correlación cero equivale a independencia, y exhibir un contraejemplo donde no.
- Explicar por qué \bar{x} y s^2 son independientes en una muestra normal, que es lo que la lección 9 dejó a deber.
De dónde viene
- Matemática 8: \det\Sigma es el factor de volumen de la Proposición 8.3, y aparece en la densidad justamente por eso.
- Matemática 9: la Proposición 9.8 —eigenvectores de una matriz simétrica son perpendiculares— es lo que permite usarlos como ejes. Sin ángulo recto no se puede medir con ellos.
- Estadística 5: la matriz de covarianza y la Proposición 5.8, donde covarianza cero no implicaba independencia. Aquí se ve qué hipótesis extra lo arregla.
- Estadística 9: el Teorema 9.6 se enunció sin demostrar y se aplazó a esta lección. La sección 4 paga esa deuda.
Para qué sirve después
- Lección 13: el modelo de regresión lineal es una normal multivariante condicionada, y sus residuos viven en el complemento ortogonal del espacio columna.
- Lección 14: los errores estándar y los intervalos de los coeficientes salen de la matriz (X^{\mathsf{T}}X)^{-1}\sigma^2, que es una matriz de covarianza como las de aquí.
- Aprendizaje automático: componentes principales es literalmente diagonalizar \Sigma; los modelos de mezcla gaussiana y el discriminante lineal son esta densidad puesta a trabajar.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| \mathbf{x} | equis negrita | Un vector de d componentes, no un número |
| \boldsymbol{\mu} | mu negrita | El vector de medias, E[\mathbf{x}] |
| \Sigma | sigma mayúscula | La matriz de covarianza: \Sigma_{ij} = \text{Cov}(x_i, x_j) |
| \Sigma^{-1} | sigma inversa | Su inversa; existe si y solo si \det\Sigma \ne 0 |
| \det\Sigma | determinante de sigma | El factor de volumen de la Definición 8.1 |
| \lambda_1, \lambda_2 | lambda uno, lambda dos | Los eigenvalores de \Sigma |
| d | de | La dimensión, es decir, cuántas variables hay |
| \chi^2_\nu | ji cuadrado sub nu | La distribución de una suma de \nu normales estándar al cuadrado |
Dos avisos. El primero: \Sigma mayúscula es una matriz de covarianza y no tiene nada que ver con \sum, el símbolo de suma; se distinguen por el contexto y porque \Sigma nunca lleva índices encima ni debajo. El segundo: en esta lección los vectores van en negrita y los escalares no, porque casi todas las fórmulas mezclan los dos.
1. La densidad
Definición 12.1 (normal multivariante). Un vector \mathbf{x} \in \mathbb{R}^{d} sigue una normal multivariante de media \boldsymbol{\mu} y covarianza \Sigma —con \Sigma simétrica y \det\Sigma > 0— si su densidad es f(\mathbf{x}) = \frac{1}{(2\pi)^{d/2}\,(\det\Sigma)^{1/2}}\; \exp\!\Big(-\tfrac{1}{2}(\mathbf{x}-\boldsymbol{\mu})^{\mathsf{T}}\Sigma^{-1}(\mathbf{x}-\boldsymbol{\mu})\Big). Se escribe \mathbf{x} \sim \mathcal{N}(\boldsymbol{\mu}, \Sigma).
Conviene desmontarla en tres piezas antes de usarla, porque cada una es una cosa ya conocida.
El exponente (\mathbf{x}-\boldsymbol{\mu})^{\mathsf{T}}\Sigma^{-1}(\mathbf{x}-\boldsymbol{\mu}) es una distancia al cuadrado, pero medida con \Sigma^{-1} en lugar de con la identidad. En d=1 se reduce a (x-\mu)^2/\sigma^2, que es el exponente de siempre. Es el producto interno de la Definición 4.1 con otra métrica: alejarse una unidad cuesta más en las direcciones donde hay poca varianza.
El \det\Sigma del denominador es el factor de volumen de la Proposición 8.3. La densidad tiene que integrar uno, y si \Sigma agranda la nube en un factor de volumen \sqrt{\det\Sigma}, la altura tiene que bajar en la misma proporción. Es la misma cuenta que hace el \sigma del denominador en una dimensión, generalizada.
El (2\pi)^{d/2} es la constante que cierra la integral, una copia de \sqrt{2\pi} por dimensión.
La condición \det\Sigma > 0 no es decorativa: si vale cero, la Proposición 8.4 dice que \Sigma no tiene inversa, y geométricamente significa que toda la masa está aplastada sobre un subespacio de dimensión menor —por ejemplo, que una variable es combinación exacta de las otras—. Ahí no hay densidad que escribir.
2. Las curvas de nivel son elipses, y sus ejes son los eigenvectores
Proposición 12.2. Las curvas de nivel de la Definición 12.1 son los conjuntos (\mathbf{x}-\boldsymbol{\mu})^{\mathsf{T}}\Sigma^{-1}(\mathbf{x}-\boldsymbol{\mu}) = c^2, elipses centradas en \boldsymbol{\mu} cuyos ejes van en la dirección de los eigenvectores de \Sigma y cuyos semiejes miden c\sqrt{\lambda_i}.
Demostración. La densidad depende de \mathbf{x} solo a través del exponente, y t \mapsto e^{-t/2} es estrictamente decreciente; luego f es constante exactamente donde lo es la forma cuadrática. Eso da la primera afirmación.
Para la segunda, sea \Sigma = \lambda_1 v_1 v_1^{\mathsf{T}} + \lambda_2 v_2 v_2^{\mathsf{T}} con v_1, v_2 los eigenvectores ortonormales de \Sigma —existen por la Proposición 9.8, y ahí está todo el peso del argumento: si no fueran perpendiculares no formarían un sistema de ejes—. Escribiendo \mathbf{x}-\boldsymbol{\mu} = a_1 v_1 + a_2 v_2, con a_i = \langle \mathbf{x}-\boldsymbol{\mu},\, v_i\rangle las coordenadas en esa base, se tiene \Sigma^{-1} = \lambda_1^{-1}v_1v_1^{\mathsf{T}} + \lambda_2^{-1}v_2v_2^{\mathsf{T}}, y usando \langle v_i, v_j\rangle = 0 para i\ne j: (\mathbf{x}-\boldsymbol{\mu})^{\mathsf{T}}\Sigma^{-1}(\mathbf{x}-\boldsymbol{\mu}) = \frac{a_1^2}{\lambda_1} + \frac{a_2^2}{\lambda_2}. Igualar eso a c^2 es la ecuación de una elipse en las coordenadas (a_1,a_2), con semiejes c\sqrt{\lambda_1} y c\sqrt{\lambda_2}. Y las coordenadas a_i se miden a lo largo de los v_i, que es lo que quiere decir que los ejes vayan en esa dirección. ∎
Lo que el visual deja ver, y que la fórmula no grita, es que \sigma_1 y \sigma_2 no son los semiejes. Con \rho \ne 0 la elipse está girada, y \sigma_1 es solo la anchura de su sombra sobre el eje x —la marca gris de abajo—, no una medida sobre la elipse misma. Los semiejes son \sqrt{\lambda_1} y \sqrt{\lambda_2}, y solo cuando \rho = 0 coinciden con \sigma_1 y \sigma_2.
Dos comprobaciones que el pie del visual hace en vivo, las dos de la lección 9:
- El ángulo entre los ejes es siempre 90°, por la Proposición 9.8, porque \Sigma es simétrica por construcción: \text{Cov}(X,Y) = \text{Cov}(Y,X) es la Proposición 5.2.
- \lambda_1\lambda_2 = \det\Sigma, por la Proposición 9.5. Como el área de una elipse de semiejes A y B es \pi AB, el área de la curva de nivel es \pi c^2\sqrt{\lambda_1\lambda_2} = \pi c^2 \sqrt{\det\Sigma}: exactamente el factor que divide en la densidad.
3. Correlación cero e independencia
La Proposición 5.8 dejó un aviso: covarianza cero no implica independencia, y el contraejemplo era Y = X^2. Bajo normalidad conjunta la implicación sí vale, y conviene ver exactamente qué hipótesis hace el trabajo.
Proposición 12.3. Si \mathbf{x} = (X, Y) \sim \mathcal{N}(\boldsymbol{\mu}, \Sigma) y \text{Cov}(X,Y) = 0, entonces X e Y son independientes.
Demostración. Con covarianza cero, \Sigma = \begin{pmatrix}\sigma_1^2 & 0\\ 0 & \sigma_2^2\end{pmatrix} es diagonal, y entonces \det\Sigma = \sigma_1^2\sigma_2^2 y \Sigma^{-1} = \begin{pmatrix}\sigma_1^{-2} & 0\\ 0 & \sigma_2^{-2}\end{pmatrix}. El exponente de la Definición 12.1 se parte en dos sumandos: (\mathbf{x}-\boldsymbol{\mu})^{\mathsf{T}}\Sigma^{-1}(\mathbf{x}-\boldsymbol{\mu}) = \frac{(x-\mu_1)^2}{\sigma_1^2} + \frac{(y-\mu_2)^2}{\sigma_2^2}, y como e^{a+b} = e^{a}e^{b}, la densidad conjunta se factoriza: f(x,y) = \underbrace{\frac{1}{\sigma_1\sqrt{2\pi}}e^{-\frac{(x-\mu_1)^2}{2\sigma_1^2}}}_{f_X(x)} \cdot \underbrace{\frac{1}{\sigma_2\sqrt{2\pi}}e^{-\frac{(y-\mu_2)^2}{2\sigma_2^2}}}_{f_Y(y)}, donde se ha repartido también la constante, usando \sqrt{\det\Sigma} = \sigma_1\sigma_2. Que la densidad conjunta sea el producto de las marginales es, por la Definición 2.9, exactamente la independencia. ∎
La hipótesis que hace el trabajo es normalidad conjunta, no que cada variable sea normal por separado. La diferencia no es un tecnicismo.
En la segunda construcción, Y = X\cdot S con S = \pm 1 al azar e independiente de X: la marginal de X es \mathcal{N}(0,1), la de Y también —un signo aleatorio no cambia una distribución simétrica—, y la covarianza es E[XY] = E[X^2 S] = E[X^2]\,E[S] = 1 \cdot 0 = 0, sacando E[S] fuera por ser S independiente de X. Pero saber X determina |Y| por completo. Las dos marginales son normales y la conjunta no lo es: su masa vive sobre dos rectas, no sobre una elipse.
Por eso la Proposición 12.3 se enuncia sobre el vector y no sobre las componentes. La franja naranja del visual lo hace visible: recorta una normal completa en el primer caso y dos picos en los otros dos.
4. La deuda de la lección 9
El Teorema 9.6 se usó allí sin demostrar: si x_1,\dots,x_n es una muestra normal, entonces (\bar{x}-\mu)/(s/\sqrt{n}) sigue una t_{n-1}. Se aplazó porque hacían falta dos hechos que ahora sí se pueden explicar.
Proposición 12.4. Sea x_1,\dots,x_n una muestra de una \mathcal{N}(\mu,\sigma^2). Entonces \bar{x} y el vector de residuos (x_1-\bar{x},\dots,x_n-\bar{x}) son independientes.
Demostración. Léase la muestra como un solo vector \mathbf{x} \in \mathbb{R}^{n}, que es una normal multivariante con \Sigma = \sigma^2 I: componentes independientes de igual varianza. Ahora, para cada i, \text{Cov}\big(\bar{x},\; x_i - \bar{x}\big) = \text{Cov}(\bar{x}, x_i) - \text{Var}(\bar{x}). El primer término vale \text{Cov}\big(\tfrac{1}{n}\sum_j x_j,\; x_i\big) = \tfrac{1}{n}\sum_j \text{Cov}(x_j, x_i) = \tfrac{1}{n}\sigma^2, porque de los n sumandos solo sobrevive j=i —los demás son independientes y su covarianza es cero por la Proposición 5.8—. El segundo vale \sigma^2/n por la Proposición 6.1. Luego la covarianza es cero, para todo i.
Hasta aquí solo hay covarianza cero, que por sí sola no bastaría: es justo lo que advertía la Proposición 5.8. Lo que cierra el argumento es que \bar{x} y los residuos son combinaciones lineales del mismo vector normal, así que juntos forman un vector conjuntamente normal, y ahí la Proposición 12.3 sí se aplica. ∎
Como s^2 se calcula a partir de los residuos y de nada más, la independencia se hereda: \bar{x} y s^2 son independientes. Geométricamente, \bar{x} vive en la dirección del vector (1,1,\dots,1) y los residuos en su complemento ortogonal —suman cero por construcción—; son las dos mitades de la proyección ortogonal de la Matemática 5, y para un vector normal con \Sigma = \sigma^2 I esas dos mitades son independientes.
La línea naranja marca la media de s^2 para cada franja de \bar{x}. Con población normal sale plana y con cualquier otra se curva, lo que deja ver que la independencia es una propiedad de la normal y no un hecho general. La exponencial la curva hacia arriba; la uniforme, hacia abajo —su soporte es acotado, y una media extrema obliga a los datos a apiñarse contra un extremo—. Ninguna de las dos se arregla creciendo n: el efecto se encoge pero no desaparece.
Nótese también que la correlación directa \text{corr}(\bar{x}, s^2) sale cerca de cero en las tres poblaciones simétricas y no distingue nada. La que delata la dependencia es la calculada sobre |\bar{x}|. Es la Proposición 5.8 otra vez: la correlación solo ve dependencia lineal.
Con la independencia en la mano, el Teorema 9.6 se arma así:
Teorema 12.5 (cerrando la deuda). Bajo muestreo normal:
- \dfrac{(n-1)s^2}{\sigma^2} \sim \chi^2_{n-1};
- \bar{x} y s^2 son independientes;
- por tanto \dfrac{\bar{x}-\mu}{s/\sqrt{n}} = \dfrac{Z}{\sqrt{W/(n-1)}} con Z \sim \mathcal{N}(0,1) y W \sim \chi^2_{n-1} independientes, y ese cociente es la definición de la t de Student con n-1 grados de libertad.
El apartado (2) es la Proposición 12.4 y queda demostrado. El (3) es álgebra: dividiendo arriba y abajo por \sigma, \frac{\bar{x}-\mu}{s/\sqrt{n}} = \frac{(\bar{x}-\mu)/(\sigma/\sqrt{n})}{s/\sigma} = \frac{Z}{\sqrt{\frac{(n-1)s^2/\sigma^2}{n-1}}}, que tiene la forma anunciada. El apartado (1) no se demuestra aquí: hace falta el teorema de Cochran, que descompone \|\mathbf{x}-\mu\mathbf{1}\|^2 en las dos piezas ortogonales y dice qué distribución tiene cada una. Es el mismo argumento de proyección, llevado un paso más lejos.
Los grados de libertad dejan de ser un nombre aquí: los residuos suman cero, así que viven en un subespacio de dimensión n-1 dentro de \mathbb{R}^{n}. Ese n-1 es literalmente una dimensión, y es el mismo que aparece en el denominador de s^2 y en el subíndice de la t.
Los cuantiles de T salen por encima de los de una normal estándar, y esa diferencia es exactamente el déficit de cobertura que se midió en la sección 4 de la lección 9. Aquel agujero y este cálculo son el mismo hecho visto dos veces.
Ejercicios
Ejercicio 1 — Los ejes de la elipse
Generar 200 000 puntos de una normal bivariante con \sigma_1 = 2, \sigma_2 = 1, \rho = 0{,}7, estimar su matriz de covarianza y comprobar que los eigenvectores de la estimada coinciden con los de la teórica. Devolver el ángulo estimado del eje mayor, en grados.
np.cov(P.T) devuelve la matriz de covarianza estimada de las columnas de P.
S_est = np.cov(P.T)El ángulo sale cerca de 21{,}5°, no de 45°: con \sigma_1 \ne \sigma_2 el eje mayor se inclina menos de lo que la intuición sugiere. La fórmula es \tfrac12\arctan\big(2\rho\sigma_1\sigma_2/(\sigma_1^2-\sigma_2^2)\big), que aquí vale \tfrac12\arctan(2{,}8/3) = 21{,}51°. Solo cuando \sigma_1 = \sigma_2 se anula el denominador y el ángulo salta a 45° exactos, sea cual sea \rho.
Ejercicio 2 — Correlación cero sin independencia
Construir X \sim \mathcal{N}(0,1) y Y = X\cdot S con S = \pm 1 equiprobable e independiente. Comprobar que la correlación es cero y que, sin embargo, |X| e |Y| están perfectamente correlacionados. Devolver la correlación entre |X| e |Y|.
La receta es literal: Y es X multiplicada por el signo aleatorio.
Y = X * SLa correlación sale del orden de 10^{-3} —ruido de muestreo— mientras que la de los valores absolutos vale exactamente 1, porque |Y| = |X| punto por punto. Y la marginal de Y sigue siendo \mathcal{N}(0,1): multiplicar una densidad simétrica por un signo aleatorio la deja igual.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 12:
- Escribir
elipse_confianza(datos, nivel)que devuelva los puntos de la elipse que contiene elnivelde la masa de una normal bivariante ajustada a esos datos. Dibujarla sobre la nube conmatplotlibpara tres niveles y medir qué fracción de puntos cae dentro de cada una: es el mismo ejercicio de cobertura de la lección 9, en dos dimensiones. - Comprobar el apartado (1) del Teorema 12.5 sin darlo por bueno: simular (n-1)s^2/\sigma^2 para varios n y contrastar su histograma con la densidad \chi^2_{n-1}. Repetirlo con población exponencial y medir dónde deja de valer.
- Implementar componentes principales a mano: centrar los datos, diagonalizar la covarianza, proyectar sobre los dos primeros eigenvectores. Aplicarlo a un conjunto de varias columnas y comparar con
sklearn.decomposition.PCA. Comprobar que la varianza explicada por cada componente es su eigenvalor dividido por la traza, y explicar por qué esa suma es la traza.
Del libro
Mathematics for Machine Learning trata la normal multivariante en MML §6.5 Gaussian Distribution, y la descomposición que sostiene la sección 2 en MML §4.4 Eigendecomposition and Diagonalization.
No se cita texto de MML porque no se pudo extraer su contenido de forma verificable al escribir esta página: solo se comprobaron los números y títulos de sección contra el índice del PDF oficial. Los enunciados y demostraciones de arriba están escritos aquí y no reproducen los del libro; pueden diferir en notación y en el orden de los pasos.
Preguntas para leer §6.5 con lápiz:
- El libro deduce la condicional de una normal multivariante: la distribución de Y sabiendo X = x. Antes de leerla: mirando el visual de la sección 2, ¿por qué esa condicional tiene que volver a ser normal, y por qué su varianza no depende del valor de x?
- Aparece también que la suma de dos normales independientes es normal. Contrastarlo con la Proposición 3.9 de la lección 3, donde el producto de factores daba una lognormal. ¿Qué operación se conserva en cada caso?
- §6.5 antecede a §6.6 Conjugacy and the Exponential Family. ¿Por qué la normal aparece como ejemplo destacado ahí, y qué tiene que ver con la forma cuadrática del exponente de la Definición 12.1?
Para el Cerebro
Nota nueva en 10-Conceptos/normal-multivariante.md, enlazada a [[eigenvalores]], [[covarianza-correlacion]] y [[intervalo-de-confianza]]. La Proposición 12.4 conviene escribirla a mano: es la que convierte «grados de libertad» de una palabra en una dimensión.
¿Qué es una normal multivariante?::Un vector cuya densidad es exp(−½ (x−μ)ᵀ Σ⁻¹ (x−μ)) dividido por (2π)^{d/2} √detΣ
¿Qué papel juega det Σ en la densidad?::Es el factor de volumen: si Σ agranda la nube, la altura de la densidad baja en la misma proporción para que integre uno
¿Qué pasa si det Σ = 0?::Σ no tiene inversa y toda la masa está aplastada sobre un subespacio menor. No hay densidad que escribir
¿Cómo son las curvas de nivel?::Elipses centradas en μ, con ejes en la dirección de los eigenvectores de Σ y semiejes c√λ
¿Son σ₁ y σ₂ los semiejes?::No, salvo si ρ = 0. σ₁ es la anchura de la sombra de la elipse sobre el eje x
¿Por qué los ejes forman siempre 90°?::Porque Σ es simétrica, y los eigenvectores de una simétrica son perpendiculares (Prop 9.8)
¿Qué relación hay entre λ₁λ₂ y det Σ?::Son iguales. El área de la elipse es proporcional a √detΣ, que es lo que divide en la densidad
¿Correlación cero implica independencia?::Solo si la distribución CONJUNTA es normal. Con marginales normales no basta
¿Cuál es el contraejemplo?::Y = X·S con S = ±1 al azar: las dos marginales son N(0,1), la covarianza es cero, y saber X determina |Y|
¿Son x̄ y s² independientes?::Sí, si la población es normal. Con cualquier otra población, no
¿Por qué lo son?::Porque su covarianza es cero y además son combinaciones lineales del mismo vector normal, así que la Prop 12.3 aplica
¿Dónde vive cada uno geométricamente?::x̄ en la dirección de (1,1,…,1); los residuos en su complemento ortogonal, porque suman cero
¿Qué son los grados de libertad?::Una dimensión de verdad: los residuos suman cero, así que viven en un subespacio de dimensión n−1
¿Cómo se arma la t de Student?::Z / √(W/(n−1)) con Z normal estándar, W ji-cuadrado con n−1 grados, y los dos independientes
¿Qué queda sin demostrar?::Que (n−1)s²/σ² sigue una ji-cuadrado: hace falta el teorema de Cochran
Fuentes
Lo que esta página demuestra sola. Las Proposiciones 12.2, 12.3 y 12.4 se demuestran aquí, a partir de la Proposición 9.8 (eigenvectores de una simétrica son ortogonales), la Proposición 9.5 (traza y determinante), la Proposición 8.3 (determinante como volumen), la Proposición 5.2 (simetría de la covarianza), la Proposición 5.8 y la Proposición 6.1. Las tres se comprueban además numéricamente: los ejes y \lambda_1\lambda_2 = \det\Sigma en la celda de la sección 2, la independencia y los momentos de la \chi^2 en la de la sección 4, y el contraejemplo de correlación cero en el segundo ejercicio. Los tres visuales se contrastaron contra numpy antes de publicarse: 36 combinaciones de la elipse, 9 de la independencia y 3 de la correlación cero.
Lo que se enuncia sin demostrar. El apartado (1) del Teorema 12.5 —que (n-1)s^2/\sigma^2 sigue una \chi^2_{n-1}— se usa sin demostración; hace falta el teorema de Cochran. Se comprueba numéricamente por sus dos primeros momentos, que no es lo mismo que demostrarlo. La Definición 12.1 se da por buena sin verificar que integra uno.
Lo que viene de los libros.
- Mathematics for Machine Learning (Deisenroth, Faisal & Ong), §6.5 Gaussian Distribution y §4.4 Eigendecomposition and Diagonalization — referenciadas por número y título verificados contra el índice del PDF oficial. No se cita texto suyo: no se pudo extraer su contenido de forma verificable.
Lo que es mío, no del libro. La numeración de definiciones y proposiciones. El desmontaje de la densidad en tres piezas de la sección 1, la insistencia en que \sigma_1 es una sombra y no un semieje, el uso de \text{corr}(|\bar{x}|, s^2) para hacer visible una dependencia que la correlación ordinaria no ve, y el encuadre de toda la sección 4 como el pago de una deuda contraída en la lección 9, son forma de presentarlo.
Índices verificados el 12-09-2026 contra el índice publicado del libro.
→ Siguiente: Regresión desde primeros principios