Mínimos cuadrados, geométricamente

Matemática · Lección 6

L3 Derivación Fase F1 Libro MML §3.8 · ISLP cap. 3 Prereqs Proyección ortogonal · Espacio columna

Objetivo

Al terminar esta lección se puede:

  1. Plantear el problema de mínimos cuadrados y demostrar, por dos caminos independientes —geometría y cálculo—, que su solución cumple las ecuaciones normales.
  2. Demostrar que la solución es única exactamente cuando la matriz de diseño tiene rango columna completo, y qué pasa cuando no lo tiene.
  3. Derivar la fórmula cerrada de la recta ajustada y reconocer en ella la correlación de la lección 4.
  4. Demostrar las identidades que el residuo cumple siempre —suma cero, ortogonalidad con cada predictor, Pitágoras— y leer R^2 como el coseno cuadrado de un ángulo.
  5. Explicar qué es la matriz sombrero, por qué su traza son los grados de libertad del modelo y por qué nunca se calcula invirtiendo A^\top A.

De dónde viene

  • Matemática 5: la proyección ortogonal y sus ecuaciones normales (Proposición 5.7). Esta lección es esa proposición leída como un problema de ajuste, con b el vector de observaciones y las columnas de A los predictores.
  • Matemática 4: Pitágoras (Proposición 4.4) parte la suma de cuadrados; y la correlación como coseno (Proposición 4.8) reaparece en la pendiente.
  • Matemática 3: el rango columna, que es exactamente la condición que decide si la solución es única.

Para qué sirve después

  • Matemática 7: la factorización QR resuelve este mismo problema sin formar nunca A^\top A, que es lo que la sección 6 justifica.
  • Estadística 13: la misma recta, deducida allí sin álgebra matricial; las dos derivaciones tienen que coincidir, y coinciden.
  • Estadística 14: la traza de la matriz sombrero es el número de coeficientes ajustados, que es el n-2 del denominador de \hat{\sigma}^2.
  • ISLP cap. 3 Linear Regression y todo el aprendizaje supervisado lineal parten de aquí.

Notación

Símbolo Se lee Significado
A, X A, X La matriz de diseño, n\times p: una fila por observación, una columna por predictor
b, y be, ye El vector de observaciones que se quiere aproximar
\hat{x}, \hat{\beta} equis sombrero Los coeficientes que resuelven el problema
\hat{y} ye sombrero El ajuste, \hat{y}=A\hat{x}: la proyección de y sobre el espacio columna
e e El residuo, e=y-\hat{y}
H hache La matriz sombrero, A(A^\top A)^{-1}A^\top; es la P de la lección 5
\text{RSS} erre ese ese \|y-A x\|^2, la suma de cuadrados de los residuos
\kappa(A) kappa de A El número de condición de A: cuánto amplifica los errores al resolver

1. El problema

Definición 6.1 (mínimos cuadrados). Dados A\in\mathbb{R}^{n\times p} y b\in\mathbb{R}^n, el problema de mínimos cuadrados consiste en encontrar \hat{x} = \arg\min_{x\in\mathbb{R}^p} \;\|b - Ax\|^2. El sistema Ax=b suele no tener solución —hay más ecuaciones que incógnitas— y esto es lo más cerca que se puede estar de resolverlo.

La cantidad que se minimiza tiene una lectura literal: cada residuo e_i es el lado de un cuadrado, y \text{RSS} es el área total. El visual deja mover la recta y ver esa área.

Mover la recta a mano y ver el área crecer es útil una vez; lo que sigue es cómo se encuentra el mínimo sin tantear.

2. Las ecuaciones normales, por dos caminos

Proposición 6.2 (camino geométrico). \hat{x} minimiza \|b-Ax\|^2 si y solo si A^\top A\,\hat{x} = A^\top b.

Demostración. El punto del espacio columna más cercano a b es su proyección ortogonal p, por la Proposición 5.8, y la Definición 5.6 la caracteriza por que su residuo sea perpendicular a todas las columnas: A^\top(b-p)=0. Escribiendo p=A\hat{x} y distribuyendo, A^\top b - A^\top A\hat{x} = 0 \quad\Longleftrightarrow\quad A^\top A\hat{x} = A^\top b. El «si y solo si» es la Proposición 5.8 en las dos direcciones: todo minimizador tiene que ser la proyección, y la proyección minimiza.

Se llaman normales porque «normal» es la palabra antigua para perpendicular, y la condición de la que salen es exactamente esa.

El segundo camino no usa geometría en absoluto, y por eso conviene: es el que se generaliza a problemas donde no hay proyección que dibujar.

Proposición 6.3 (camino de cálculo, y unicidad). La función \text{RSS}(x)=\|b-Ax\|^2 es convexa, su gradiente se anula exactamente en las soluciones de las ecuaciones normales, y su Hessiana es 2A^\top A. La solución es única si y solo si A tiene rango columna completo.

Demostración. Expandiendo, y usando que x^\top A^\top b es un escalar y por tanto igual a su traspuesta b^\top Ax: \text{RSS}(x) = (b-Ax)^\top(b-Ax) = b^\top b - 2\,x^\top A^\top b + x^\top A^\top A\,x. Los dos gradientes que hacen falta son \nabla_x(x^\top c)=c y \nabla_x(x^\top Mx)=2Mx para M simétrica —y A^\top A lo es siempre—, de modo que \nabla_x\text{RSS} = -2A^\top b + 2A^\top A\,x, que se anula exactamente en A^\top A x = A^\top b. La Hessiana es 2A^\top A, y para todo v, v^\top(A^\top A)v = (Av)^\top(Av) = \|Av\|^2 \ge 0, así que es semidefinida positiva y la función es convexa: todo punto crítico es mínimo global. Es definida positiva —y por tanto el mínimo es único— si y solo si \|Av\|^2>0 para todo v\ne 0, es decir si y solo si Av=0 implica v=0, que es la definición de rango columna completo. Si el rango no es completo, existe v\ne0 con Av=0 y entonces \hat{x}+v da exactamente el mismo ajuste: el valle tiene fondo plano en esa dirección y hay infinitas soluciones, todas con el mismo \hat{y}.

Que los dos caminos lleguen a la misma ecuación no es casualidad, y conviene tenerlo presente: la geometría y la optimización son dos lenguajes para lo mismo, y el resto del plan cruza ese puente en los dos sentidos.

Important

\hat{x}=(A^\top A)^{-1}A^\top b es correcto y es la fórmula que aparece escrita en todas partes, pero no es cómo se calcula. La sección 6 explica por qué.

3. El caso de una variable

Proposición 6.4 (recta ajustada). Con matriz de diseño X=[\,\mathbf{1}\;\;x\,], las ecuaciones normales dan \hat{\beta}_0 = \bar{y}-\hat{\beta}_1\bar{x}, \qquad \hat{\beta}_1 = \frac{\sum_i(x_i-\bar{x})(y_i-\bar{y})}{\sum_i(x_i-\bar{x})^2} = \frac{S_{xy}}{S_{xx}} = r_{xy}\,\frac{s_y}{s_x}. En particular, la recta pasa siempre por el centroide (\bar{x},\bar{y}).

Demostración. Las dos piezas del sistema son X^\top X = \begin{bmatrix} n & \sum_i x_i \\ \sum_i x_i & \sum_i x_i^2\end{bmatrix}, \qquad X^\top y = \begin{bmatrix} \sum_i y_i \\ \sum_i x_iy_i\end{bmatrix}. La primera ecuación es n\beta_0 + (\sum_i x_i)\beta_1 = \sum_i y_i; dividiendo entre n queda \beta_0+\beta_1\bar{x}=\bar{y}, que es a la vez la fórmula de \hat{\beta}_0 y la afirmación de que el punto (\bar{x},\bar{y}) está sobre la recta. Sustituyendo ese \beta_0 en la segunda ecuación y agrupando: \hat{\beta}_1 = \frac{n\sum_i x_iy_i - \sum_i x_i\sum_i y_i}{n\sum_i x_i^2-(\sum_i x_i)^2} = \frac{\sum_i(x_i-\bar{x})(y_i-\bar{y})}{\sum_i(x_i-\bar{x})^2}, donde la segunda igualdad es dividir numerador y denominador entre n y reconocer las sumas centradas. Finalmente, dividiendo y multiplicando por s_xs_y aparece r_{xy}s_y/s_x, con r_{xy} la correlación de la Proposición 4.8.

La última forma cierra el círculo con la lección 4: la correlación era el coseno del ángulo entre las variables centradas, así que la pendiente de la regresión es ese coseno con las unidades puestas. La primera forma explica por qué la recta pasa por el centroide: es consecuencia de tener columna de unos, y de nada más.

Los tres caminos —sistema, fórmula cerrada y lstsq— dan el mismo vector hasta el sexto decimal, que es lo que la Proposición 6.4 promete.

4. Lo que el residuo garantiza

Además de servir para calcular, las ecuaciones normales son p identidades que se cumplen siempre, con cualquier conjunto de datos y sin ningún supuesto estadístico.

Proposición 6.5 (identidades del residuo). Sea e=y-A\hat{x} con \hat{x} solución de las ecuaciones normales. Entonces:

  1. A^\top e = 0: el residuo es ortogonal a cada columna. En particular, si A tiene columna de unos, \sum_i e_i = 0.
  2. \hat{y}^\top e = 0: el ajuste y el residuo son ortogonales.
  3. \|y\|^2 = \|\hat{y}\|^2 + \|e\|^2, y con columna de unos, en versión centrada, \text{TSS} = \text{ESS} + \text{RSS}.
  4. R^2 = \text{ESS}/\text{TSS} = \cos^2\theta, donde \theta es el ángulo entre y centrado y \hat{y} centrado.

Demostración. (1) es la ecuación normal reordenada, A^\top(y-A\hat{x})=0; la fila correspondiente a la columna de unos dice \mathbf{1}^\top e=\sum_ie_i=0. (2) \hat{y}^\top e = (A\hat{x})^\top e = \hat{x}^\top(A^\top e) = 0 por (1). (3) es Pitágoras (Proposición 4.4) aplicado a y=\hat{y}+e, que es legítimo por (2); la versión centrada es la misma cuenta tras restar \bar{y}\mathbf{1}, que por la Proposición 5.9 no altera la ortogonalidad porque \mathbf{1} está en el espacio columna. (4) Por definición R^2 = \text{ESS}/\text{TSS} con \text{ESS}=\|\hat{y}-\bar{y}\mathbf{1}\|^2 y \text{TSS}=\|y-\bar{y}\mathbf{1}\|^2. Llamando \tilde{y}=y-\bar{y}\mathbf{1} y \tilde{\hat{y}}=\hat{y}-\bar{y}\mathbf{1}, la descomposición (3) dice que \tilde{\hat{y}} es la proyección de \tilde{y}, de modo que \langle\tilde{y},\tilde{\hat{y}}\rangle = \|\tilde{\hat{y}}\|^2 y \cos^2\theta = \frac{\langle\tilde{y},\tilde{\hat{y}}\rangle^2}{\|\tilde{y}\|^2\|\tilde{\hat{y}}\|^2} = \frac{\|\tilde{\hat{y}}\|^4}{\|\tilde{y}\|^2\|\tilde{\hat{y}}\|^2} = \frac{\|\tilde{\hat{y}}\|^2}{\|\tilde{y}\|^2} = \frac{\text{ESS}}{\text{TSS}}.

El apartado (4) le da a R^2 un significado geométrico exacto: mide cuánto apunta y hacia el espacio columna, con el mismo coseno de la lección 4. Y el apartado (1) explica por qué los residuos de una regresión con intercepto suman cero: lo impone una de las ecuaciones que el ajuste resuelve, y por eso ocurre con cualquier conjunto de datos.

5. La matriz sombrero y los grados de libertad

Definición 6.6 (matriz sombrero). H = A(A^\top A)^{-1}A^\top, de modo que \hat{y}=Hy. Le pone el sombrero a y, y es la matriz de proyección de la Definición 5.6 con otro nombre.

Proposición 6.7. H es simétrica e idempotente, sus eigenvalores son ceros y unos, y \operatorname{traza}(H) = p, el número de columnas de A. Su diagonal h_{ii}\in[0,1] mide cuánto influye la observación i sobre su propia predicción.

Demostración. Las tres primeras afirmaciones son la Proposición 5.5 y la 5.8, que se demostraron para una matriz de proyección cualquiera. Para la diagonal: h_{ii} = \langle H e_i, e_i\rangle con e_i el vector canónico, y por idempotencia y simetría h_{ii} = \|He_i\|^2 \ge 0; además H e_i es una proyección de un vector unitario, luego \|He_i\|\le\|e_i\|=1 —la proyección nunca alarga, por la Proposición 5.8 con b=e_i—, de donde h_{ii}\le 1.

Esa traza es la definición operativa de grados de libertad del modelo: cuántas dimensiones de y se consumieron al ajustar. Con p columnas se gastan p, y a los residuos les quedan n-p; de ahí sale el denominador n-p de \hat{\sigma}^2 en Estadística 14, y de ahí salen las penalizaciones de los criterios de selección de modelos.

El leverage de los extremos —los puntos en x=1 y x=9— duplica al del centro. No es una propiedad de los datos observados sino de dónde se colocaron las x, y es la misma cuenta que en Estadística 14 hacía que \text{Var}(\hat\beta_1)=\sigma^2/\text{SCX} bajara al separar los predictores.

6. Por qué nunca se invierte A^\top A

Las ecuaciones normales son exactas en matemáticas y frágiles en punto flotante, por una razón que cabe en una línea.

Proposición 6.8 (el condicionamiento se eleva al cuadrado). Para A de rango columna completo, el número de condición en norma 2 cumple \kappa(A^\top A) = \kappa(A)^2. En consecuencia, resolver por ecuaciones normales pierde aproximadamente el doble de dígitos significativos que resolver factorizando A directamente.

La demostración necesita los valores singulares de A —los eigenvalores de A^\top A son sus cuadrados—, que es material de la lección 11; aquí se enuncia y se comprueba numéricamente, y queda declarado en Fuentes. La consecuencia práctica sí conviene tenerla desde ahora: no se forma A^\top A. Se factoriza A con QR (lección 7) o con SVD, que es lo que np.linalg.lstsq hace por dentro.

El número de condición pasa de 10^{7} a 10^{14} solo por formar A^\top A, y el residuo que consigue lstsq es varios órdenes de magnitud menor. La regla para el resto del plan: np.linalg.lstsq, nunca np.linalg.inv(X.T @ X) @ X.T @ y.

Ejercicios

Ejercicio 1 — Resolver mínimos cuadrados a mano

Ajusta un modelo con intercepto y dos predictores resolviendo las ecuaciones normales. Devuelve el vector de coeficientes.

Las ecuaciones normales son X^\top X\,\hat\beta = X^\top y. Eso es un sistema lineal cuadrado: np.linalg.solve(A, b) con A = X.T @ X y b = X.T @ y. No uses inv.

Ejercicio 2 — Grados de libertad desde la matriz sombrero

Construye H y devuelve su traza. Sin contar columnas: que te lo diga la matriz.

H = X(X^\top X)^{-1}X^\top. Para evitar inv, nota que (X^\top X)^{-1}X^\top es la solución de X^\top X\,M = X^\top, o sea np.linalg.solve(X.T @ X, X.T). Después multiplica por X a la izquierda.

Reto

En proyectos/notebooks/F1-retos.ipynb, sección Mat 6:

  1. Escribir ols(X, y) que reciba una matriz de diseño sin columna de unos, le agregue el intercepto, resuelva por QR o SVD —no por ecuaciones normales— y devuelva beta, y_hat, residuos, r2 y leverage. Probarla contra np.linalg.lstsq en doscientos conjuntos aleatorios.
  2. Tomar los nueve puntos del visual y mover el último (x=9) de 8,0 a 14,0 en veinte pasos, graficando cómo cambian \hat\beta_0, \hat\beta_1 y R^2. Repetir moviendo el punto del medio (x=5) la misma cantidad, y explicar la diferencia entre las dos pendientes de cambio con el leverage h_{ii} de la Proposición 6.7.
  3. Construir una matriz de diseño con dos columnas casi colineales y resolver el mismo problema por tres caminos: ecuaciones normales con inv, ecuaciones normales con solve, y lstsq. Medir el error en cada uno y ordenarlos. Después comprobar la Proposición 6.8 numéricamente sobre veinte matrices de condicionamiento creciente: graficar \kappa(A^\top A) contra \kappa(A)^2 y ver que caen sobre la diagonal.

Del libro

Mathematics for Machine Learning trata la proyección que hay detrás de todo esto en §3.8 Orthogonal Projections; ISLP dedica su capítulo 3, Linear Regression, a la lectura estadística de la misma cuenta —errores estándar, contrastes y diagnóstico—, que es la que recogen las lecciones 13 y 14 de Estadística.

Ninguno de los dos es descargable desde el entorno en que se escribió esta página, y de ISLP solo está verificado el índice a nivel de capítulo, así que se citan por número y título y no se les atribuye ninguna frase.

Preguntas para leer con lápiz:

  1. MML §3.8 obtiene la proyección minimizando una distancia. ¿En qué punto de ese argumento aparece la condición A^\top(b-p)=0 que aquí es la Definición 5.6?
  2. ISLP cap. 3 llama residual standard error a \sqrt{\text{RSS}/(n-p)}. ¿De dónde sale ese n-p, según la Proposición 6.7?
  3. ISLP cap. 3 discute qué pasa cuando dos predictores están muy correlacionados. Contrastarlo con la Proposición 6.3 —unicidad— y con la 6.8 —condicionamiento—: ¿son el mismo problema o dos distintos?

Para el Cerebro

Nota nueva en 10-Conceptos/minimos-cuadrados.md, enlazada a [[proyeccion-ortogonal]], [[producto-interno]] y [[regresion-lineal]]. Las Proposiciones 6.2 y 6.3 conviene hacerlas las dos a mano, una detrás de otra: ver la misma ecuación salir de la geometría y del cálculo es lo que deja la idea instalada.

¿Qué problema resuelve mínimos cuadrados?::Encontrar el x que minimiza ‖b − Ax‖², cuando Ax = b no tiene solución
¿Cuáles son las ecuaciones normales?::AᵀA x̂ = Aᵀb
¿De dónde salen, geométricamente?::De exigir que el residuo sea perpendicular a todas las columnas de A
¿De dónde salen, por cálculo?::De igualar a cero el gradiente de RSS(x) = bᵀb − 2xᵀAᵀb + xᵀAᵀAx
¿Cuándo es única la solución?::Cuando A tiene rango columna completo; si no, hay infinitas con el mismo ŷ
¿Por qué el mínimo es global?::Porque la Hessiana 2AᵀA es semidefinida positiva: la función es convexa
¿Cuánto vale la pendiente en regresión simple?::Sxy/Sxx = r·(sy/sx): la correlación con las unidades puestas
¿Por qué la recta pasa por (x̄, ȳ)?::Por la fila de la columna de unos en las ecuaciones normales
¿Qué garantiza Aᵀe = 0?::Residuos que suman cero (con intercepto) y descorrelacionados con cada predictor
¿Qué es R² geométricamente?::El coseno cuadrado del ángulo entre y centrado y ŷ centrado
¿Qué es la matriz sombrero?::H = A(AᵀA)⁻¹Aᵀ, la proyección sobre el espacio columna: ŷ = Hy
¿Qué mide la traza de H?::Los grados de libertad del modelo: p, el número de columnas ajustadas
¿Qué mide hᵢᵢ?::El leverage: cuánto influye la observación i sobre su propia predicción
¿Por qué no se invierte AᵀA?::Porque κ(AᵀA) = κ(A)², y se pierde el doble de dígitos; se factoriza A con QR o SVD

Fuentes

Lo que esta página demuestra sola. Las Proposiciones 6.2, 6.3, 6.4, 6.5 y 6.7 se demuestran aquí, a partir de la proyección ortogonal de la lección 5 —Definición 5.6 y Proposiciones 5.5, 5.8 y 5.9— y del teorema de Pitágoras de la lección 4. Se comprueban además numéricamente: los tres caminos de cálculo de \hat\beta coincidiendo hasta el sexto decimal; X^\top e=0, \hat{y}^\top e=0, \text{TSS}=\text{ESS}+\text{RSS} y R^2=\cos^2\theta sobre el mismo conjunto; las propiedades de H con su traza igual al número de columnas y la suma de los leverages; y el efecto del condicionamiento en un diseño casi colineal. El visual es el de la versión anterior de esta lección, ya conforme: los cuadrados de los residuos son el área que se minimiza, y el botón deja comparar cualquier recta con la óptima.

Lo que se usa de otras lecciones sin repetir. La proyección ortogonal, sus ecuaciones normales y la matriz P son la lección 5. Pitágoras y la correlación como coseno, la lección 4. El rango columna, la lección 3. Los dos gradientes matriciales, \nabla_x(x^\top c)=c y \nabla_x(x^\top Mx)=2Mx con M simétrica, se usan sin demostrar aquí y se derivan en Estadística 13.

Lo que se enuncia sin demostrar. La Proposición 6.8, \kappa(A^\top A)=\kappa(A)^2: la demostración necesita los valores singulares de A, que son material de la lección 11. Aquí se comprueba numéricamente sobre un diseño casi colineal, lo que no es lo mismo que demostrarla.

Lo que viene de los libros.

  • Mathematics for Machine Learning (Deisenroth, Faisal & Ong, Cambridge University Press, 2020), §3.8 Orthogonal Projections — citada por número y título.
  • ISLP, cap. 3 Linear Regression — citado por número y título de capítulo; de ISLP solo hay índice verificado a ese nivel.

Ninguno de los dos se transcribe: no son extraíbles de forma verificable desde este entorno.

Lo que es mío, no del libro. Presentar las dos derivaciones en paralelo y señalar que son dos lenguajes para lo mismo; leer R^2 como \cos^2\theta y demostrarlo; y el hilo que conecta la traza de la matriz sombrero con los grados de libertad de \hat\sigma^2 en Estadística 14.

Índices verificados el 12-09-2026 contra los índices publicados de cada libro.

→ Siguiente: Gram-Schmidt y la factorización QR