Proyección ortogonal
Matemática · Lección 5
Objetivo
Al terminar esta lección se puede:
- Derivar la fórmula de la proyección ortogonal sobre una recta a partir de una sola condición: que el residuo sea perpendicular.
- Demostrar que la proyección es el punto más cercano del subespacio, usando el teorema de Pitágoras de la lección 4.
- Demostrar que la matriz de proyección cumple P^2=P y P^\top=P, que sus eigenvalores son ceros y unos, y que su traza es su rango.
- Generalizar de una recta a un subespacio cualquiera con las ecuaciones normales A^\top A\hat{x} = A^\top b, y reconocer que centrar una variable es un caso particular de todo esto.
De dónde viene
- Matemática 4: el producto interno, la ortogonalidad (Definición 4.3) y sobre todo la Proposición 4.4 —Pitágoras—, que es la que convierte «perpendicular» en «el más cercano».
- Matemática 3: el espacio columna de una matriz. Proyectar sobre un subespacio es proyectar sobre el espacio columna de la matriz que lo genera.
Para qué sirve después
- Matemática 6: mínimos cuadrados es exactamente esta lección aplicada al vector de observaciones y al espacio columna de la matriz de diseño; las ecuaciones normales de la Proposición 5.7 son las de allí.
- Matemática 7: Gram-Schmidt construye una base ortonormal restando proyecciones, una a una.
- Estadística 13 y 14: la recta de regresión es una proyección, los residuos son el vector b-p, y la traza de P es el número de coeficientes ajustados —los grados de libertad que se restan en \hat{\sigma}^2—.
- Estadística 4 y 5: centrar una variable, que allí es «restarle la media», aquí resulta ser la proyección sobre el complemento ortogonal del vector de unos (Proposición 5.9).
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| a, b | a, be | Vectores de \mathbb{R}^n: a genera la recta sobre la que se proyecta, b es lo que se proyecta |
| p | pe | La proyección de b: la sombra que cae sobre el subespacio |
| e | e | El residuo, e = b - p. Aquí es eso; en Estadística 13 es el residuo de la regresión, que es el mismo objeto |
| A | A | Matriz n\times k cuyas columnas generan el subespacio |
| P | pe mayúscula | La matriz de proyección: p = Pb para todo b |
| \mathbf{1} | uno | El vector de unos, (1,1,\dots,1)^\top |
| \hat{x} | equis sombrero | Los coeficientes de la proyección en la base de columnas: p = A\hat{x} |
1. La sombra sobre una recta
Definición 5.1 (proyección sobre una recta). Sea a\ne 0. La proyección ortogonal de b sobre la recta \{ta : t\in\mathbb{R}\} es el único punto p de esa recta tal que b-p es ortogonal a a.
La definición no dice cómo calcular p; dice qué propiedad lo caracteriza. La fórmula sale de imponerla.
Proposición 5.2 (la fórmula). Ese punto existe, es único, y vale p = \frac{\langle a,b\rangle}{\langle a,a\rangle}\,a \;=\; \frac{a\,a^\top}{a^\top a}\,b.
Demostración. Todo punto de la recta es de la forma ta, así que basta encontrar el escalar t. La condición de la Definición 5.1 es \langle a,\, b-ta\rangle = 0, y por linealidad del producto interno (Definición 4.1), \langle a,b\rangle - t\,\langle a,a\rangle = 0 \quad\Longrightarrow\quad t = \frac{\langle a,b\rangle}{\langle a,a\rangle}, donde la división es legítima porque \langle a,a\rangle = \|a\|^2 > 0 al ser a\ne 0 y el producto interno definido positivo. El valor de t queda determinado sin ninguna libertad, de modo que p=ta existe y es único. Para la segunda forma, por asociatividad del producto de matrices, \frac{\langle a,b\rangle}{\langle a,a\rangle}a = \frac{a\,(a^\top b)}{a^\top a} = \frac{(a\,a^\top)\,b}{a^\top a}, que es multiplicar b por una matriz fija, la misma para todo b. ∎
La condición de perpendicularidad se eligió por su significado geométrico, pero lo que la vuelve la definición correcta es que produce el punto más cercano.
Proposición 5.3 (mejor aproximación). Para todo t\in\mathbb{R}, \|b - ta\|^2 = \|b-p\|^2 + \|p - ta\|^2 \;\ge\; \|b-p\|^2, con igualdad si y solo si ta=p. La proyección es, por tanto, el punto de la recta que minimiza la distancia a b.
Demostración. Escríbase b-ta = (b-p) + (p-ta). El primer sumando es el residuo e, ortogonal a a por la Definición 5.1; el segundo es un múltiplo de a, porque tanto p como ta lo son. Dos vectores así son ortogonales entre sí: \langle e,\, p-ta\rangle = 0. Aplicando la Proposición 4.4 —Pitágoras— a esa descomposición, \|b-ta\|^2 = \|b-p\|^2 + \|p-ta\|^2. El segundo sumando es no negativo y vale cero exactamente cuando ta=p. ∎
Merece subrayarse de dónde viene el mínimo: no de derivar e igualar a cero, sino de Pitágoras. Optimizar aquí es geometría, no cálculo, y esa es la razón de que la solución sea única y exacta en vez de aproximada.
La parábola de la derecha es la Proposición 5.3 dibujada: sea cual sea la dirección de b, su mínimo cae exactamente donde está la sombra, y el residuo sale perpendicular a la recta —la marca de ángulo recto del pie—. Los dos extremos también se leen ahí: con b sobre la recta el residuo se anula, y con b perpendicular la sombra colapsa al origen.
2. La matriz de proyección
La segunda forma de la Proposición 5.2 dice que proyectar es multiplicar por una matriz fija. Esa matriz tiene dos propiedades que la caracterizan.
Definición 5.4 (matriz de proyección sobre una recta). P = \dfrac{a\,a^\top}{a^\top a}, de modo que p = Pb para todo b.
Proposición 5.5 (propiedades de P). La matriz de la Definición 5.4 cumple:
- P^\top = P (simétrica);
- P^2 = P (idempotente);
- sus eigenvalores son 1 —con multiplicidad 1, en la dirección de a— y 0 —con multiplicidad n-1—;
- I-P es la matriz de proyección sobre el complemento ortogonal, y P(I-P)=0.
Demostración. (1) (a\,a^\top)^\top = a\,a^\top porque trasponer un producto invierte el orden, y el denominador es un escalar. (2) Multiplicando y usando asociatividad, P^2 = \frac{a\,a^\top}{a^\top a}\cdot\frac{a\,a^\top}{a^\top a} = \frac{a\,(a^\top a)\,a^\top}{(a^\top a)^2} = \frac{a\,a^\top}{a^\top a} = P, porque el factor central a^\top a es un escalar que se cancela con uno del denominador. (3) Pa = a(a^\top a)/(a^\top a) = a, así que a es eigenvector de eigenvalor 1; y si v\perp a, entonces Pv = a(a^\top v)/(a^\top a) = 0, así que todo el complemento ortogonal —de dimensión n-1— es eigenespacio de eigenvalor 0. Eso agota \mathbb{R}^n. (4) (I-P)^\top = I-P y (I-P)^2 = I - 2P + P^2 = I-2P+P = I-P usando (2); y P(I-P) = P - P^2 = 0. ∎
Que P^2=P no es un tecnicismo: dice que proyectar dos veces es lo mismo que proyectar una, lo cual es obvio en cuanto se piensa en la sombra —una vez que ya está sobre la recta, volver a proyectarla no la mueve—. Y el apartado (4) dice que el residuo también es una proyección: la de b sobre todo lo que la recta no cubre. Las dos piezas de Pitágoras son, entonces, dos proyecciones complementarias.
3. De una recta a un subespacio
El argumento no usó en ningún momento que el subespacio fuera de dimensión 1. Con k direcciones, la condición de perpendicularidad hay que imponerla contra todas a la vez.
Definición 5.6 (proyección sobre un subespacio). Sea A una matriz n\times k de columnas linealmente independientes. La proyección de b sobre el espacio columna de A es el único p = A\hat{x} tal que b-p es ortogonal a todas las columnas de A, es decir A^\top(b-p)=0.
Proposición 5.7 (ecuaciones normales). Con A de columnas independientes, A^\top A es invertible y A^\top A\,\hat{x} = A^\top b, \qquad \hat{x} = (A^\top A)^{-1}A^\top b, \qquad P = A(A^\top A)^{-1}A^\top.
Demostración. La condición A^\top(b-A\hat{x})=0 se reordena en A^\top A\hat{x} = A^\top b por linealidad. Falta ver que A^\top A es invertible. Supóngase A^\top A v = 0 para algún v; entonces 0 = v^\top A^\top A v = (Av)^\top(Av) = \|Av\|^2, y por ser el producto interno definido positivo, Av=0. Como las columnas de A son independientes, eso obliga a v=0: el núcleo de A^\top A es trivial y la matriz, cuadrada k\times k, es invertible. Sustituyendo \hat{x} en p=A\hat{x} sale la expresión de P. Las cuatro propiedades de la Proposición 5.5 se comprueban igual: P^\top = P por construcción, y P^2 = A(A^\top A)^{-1}\underbrace{A^\top A(A^\top A)^{-1}}_{I}A^\top = A(A^\top A)^{-1}A^\top = P. ∎
Proposición 5.8 (mejor aproximación en el subespacio). Para todo x\in\mathbb{R}^k, \|b - Ax\|^2 = \|b-p\|^2 + \|p - Ax\|^2 \;\ge\; \|b-p\|^2, con igualdad solo si Ax=p. Además \operatorname{traza}(P) = k, el número de columnas.
Demostración. La descomposición es la misma de la Proposición 5.3: b-Ax = (b-p) + (p-Ax), donde p-Ax está en el espacio columna y b-p es ortogonal a él por la Definición 5.6; Pitágoras (Proposición 4.4) separa los cuadrados. Para la traza, por la propiedad cíclica, \operatorname{traza}(P) = \operatorname{traza}\big(A(A^\top A)^{-1}A^\top\big) = \operatorname{traza}\big((A^\top A)^{-1}A^\top A\big) = \operatorname{traza}(I_k) = k. ∎
Ese último número reaparecerá con otro nombre: la traza de la matriz de proyección es el número de direcciones que el modelo puede ajustar, y es lo que en Estadística 14 se resta al contar los grados de libertad de \hat{\sigma}^2.
El punto hueco es un Ax cualquiera y el relleno es la proyección. La lectura confirma las dos proposiciones a la vez: los dos productos internos contra a_1 y a_2 salen en el error de máquina —el residuo es perpendicular al plano entero, no solo a una dirección—, y la diferencia de cuadrados entre la distancia de prueba y la mínima coincide dígito a dígito con \|p-q\|^2, que es Pitágoras otra vez.
4. Centrar es proyectar
La operación más común de toda la estadística descriptiva resulta ser un caso particular de esta lección.
Proposición 5.9 (la media es una proyección). Sea \mathbf{1}=(1,\dots,1)^\top\in\mathbb{R}^n y x\in\mathbb{R}^n. La proyección de x sobre la recta generada por \mathbf{1} es p = \bar{x}\,\mathbf{1}, \qquad \bar{x}=\frac{1}{n}\sum_i x_i, y su residuo es el vector centrado \tilde{x}, con \tilde{x}\perp\mathbf{1} y \sum_i\tilde{x}_i=0.
Demostración. Aplíquese la Proposición 5.2 con a=\mathbf{1}: \langle\mathbf{1},x\rangle = \sum_i x_i y \langle\mathbf{1},\mathbf{1}\rangle = n, de modo que p = \frac{\sum_i x_i}{n}\,\mathbf{1} = \bar{x}\,\mathbf{1}. El residuo es e = x - \bar{x}\mathbf{1}, cuya coordenada i es x_i-\bar{x}: exactamente el vector centrado. Que sea ortogonal a \mathbf{1} es la Definición 5.1, y escrito en coordenadas, \langle\mathbf{1},\tilde{x}\rangle = \sum_i(x_i-\bar{x}) = 0: las desviaciones respecto de la media suman cero. ∎
Tres cosas que estaban sueltas quedan atadas por esta proposición. Que las desviaciones respecto de la media sumen cero deja de ser un truco algebraico y pasa a ser la ortogonalidad del residuo. Que la media sea el número que minimiza \sum_i(x_i-c)^2 es la Proposición 5.3 con a=\mathbf{1}. Y el centrado que la lección 4 exigía antes de calcular el coseno —y que Estadística 5 exige antes de calcular la correlación— es quitarle a cada variable su sombra sobre \mathbf{1}.
Ejercicios
Ejercicio 1 — Proyectar sobre una recta
Calcular la proyección de b sobre la dirección de a, con la fórmula de la Proposición 5.2.
La fórmula es p = \dfrac{a^\top b}{a^\top a}\,a. En NumPy el producto interno es a @ b, y el resultado se multiplica por el vector a completo.
Ejercicio 2 — La matriz de proyección
Construir P y comprobar que es idempotente, que es el apartado (2) de la Proposición 5.5.
P = \dfrac{a\,a^\top}{a^\top a}. El producto exterior a\,a^\top es np.outer(a, a); el denominador es el escalar a @ a.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Mat 5:
- Añadir
proyectar(b, A)ascratch/lineal.py, que funcione tanto siAes un vector como si es una matriz, y devuelva el par (p, e). Probar sobre cien casos de dimensiones variadas que A^\top e\approx 0 y que P^2=P a tolerancia 10^{-12}. - Rango deficiente. Construir P = A(A^\top A)^{-1}A^\top con una A cuyas columnas no sean independientes y ver qué ocurre. Después usar
np.linalg.pinven lugar deinvy comparar: ¿qué hace la pseudoinversa que la inversa no puede, y en qué queda la Proposición 5.7 cuando su hipótesis falla? Anotarlo en50-Errores/. - Comprobar que la matriz de centrado C = I - \frac{1}{n}\mathbf{1}\mathbf{1}^\top de la Proposición 5.9 cumple C^2=C y C\mathbf{1}=0, y que centrar una matriz de datos por columnas es multiplicarla por C a la izquierda. Después comprobar que la matriz de covarianza muestral es \frac{1}{n-1}X^\top C X: la covarianza es un producto interno entre variables ya proyectadas.
Del libro
Mathematics for Machine Learning trata este material en §3.8 Orthogonal Projections, con §3.6 Orthogonal Complement para el residuo y §3.5 Orthonormal Basis para el caso en que las columnas ya vienen ortonormales, donde A^\top A = I y las ecuaciones normales se reducen a \hat{x}=A^\top b.
El libro tiene copyright y no es descargable desde el entorno en que se escribió esta página, así que se cita número y título y no se le atribuye ninguna frase.
Preguntas para leer §3.5, §3.6 y §3.8 con lápiz:
- ¿Qué dimensión tiene el complemento ortogonal de un subespacio de dimensión k dentro de \mathbb{R}^n, y cómo se relaciona eso con el apartado (4) de la Proposición 5.5?
- Si las columnas de A son ortonormales, ¿en qué se convierte (A^\top A)^{-1}, y por qué eso hace la proyección tan barata de calcular?
- MML presenta la proyección minimizando una distancia. ¿En qué punto de ese argumento aparece —explícita o implícitamente— el teorema de Pitágoras que aquí es la Proposición 4.4?
Para el Cerebro
Nota nueva en 10-Conceptos/proyeccion-ortogonal.md, enlazada a [[producto-interno]], [[espacio-columna]] y [[minimos-cuadrados]]. La Proposición 5.9 conviene rehacerla a mano: es corta y convierte «restar la media» en un caso particular de proyectar, que es de las pocas ideas que ahorran memoria de verdad.
¿Qué caracteriza a la proyección ortogonal?::Que el residuo b − p sea perpendicular al subespacio (Definición 5.1)
¿Cuál es la fórmula sobre una recta?::p = (⟨a,b⟩/⟨a,a⟩)·a, y en forma matricial P = a aᵀ/(aᵀa)
¿Por qué la proyección es el punto más cercano?::Por Pitágoras: ‖b − ta‖² = ‖b − p‖² + ‖p − ta‖² ≥ ‖b − p‖²
¿Qué dos propiedades tiene la matriz de proyección?::Simétrica (Pᵀ = P) e idempotente (P² = P)
¿Qué significa P² = P?::Que proyectar dos veces es lo mismo que proyectar una: la sombra ya está en el subespacio
¿Cuáles son los eigenvalores de P?::Solo unos y ceros: 1 en las direcciones que sobreviven, 0 en las que aniquila
¿Qué es I − P?::La proyección sobre el complemento ortogonal; P(I−P) = 0
¿Cuáles son las ecuaciones normales?::AᵀA x̂ = Aᵀb, que salen de exigir Aᵀ(b − Ax̂) = 0
¿Por qué AᵀA es invertible?::Porque AᵀAv = 0 implica ‖Av‖² = 0, y con columnas independientes eso obliga a v = 0
¿Cuánto vale la traza de P?::El número de columnas de A: los grados de libertad que consume el modelo
¿Qué proyección es restar la media?::La proyección sobre la recta del vector de unos; el residuo es el vector centrado (Proposición 5.9)
¿Por qué las desviaciones respecto de la media suman cero?::Porque el residuo de esa proyección es ortogonal al vector de unos
Fuentes
Lo que esta página demuestra sola. Todo: las Proposiciones 5.2, 5.3, 5.5, 5.7, 5.8 y 5.9 se demuestran aquí a partir de la Definición 5.1 y de las propiedades del producto interno de la lección 4, con la Proposición 4.4 —Pitágoras— como única herramienta para los dos resultados de mejor aproximación. Se comprueban además numéricamente: la perpendicularidad del residuo y Pitágoras sobre una recta; P^\top=P, P^2=P, los eigenvalores \{0,1\} y P(I-P)=0; la generalización a un plano dentro de \mathbb{R}^6, con la traza igual al número de columnas y con 20 000 puntos del plano que no consiguen acercarse más que la proyección; y la Proposición 5.9, con la media saliendo de la fórmula de proyección y la rejilla confirmando que minimiza la suma de cuadrados. Los dos visuales se contrastaron antes de publicarse: 180 direcciones × 37 puntos de prueba para el primero, y 19 alturas × 25 × 25 puntos del plano para el segundo.
Lo que se usa de otras lecciones sin repetir. El producto interno, sus tres propiedades y el teorema de Pitágoras son la lección 4. El espacio columna y la independencia lineal, la lección 3.
Lo que se enuncia sin demostrar. Nada.
Lo que viene de los libros.
- Mathematics for Machine Learning (Deisenroth, Faisal & Ong, Cambridge University Press, 2020), §3.5 Orthonormal Basis, §3.6 Orthogonal Complement y §3.8 Orthogonal Projections — citadas por número y título. El libro tiene copyright y no es descargable desde este entorno, así que no se transcribe ninguna frase.
Lo que es mío, no del libro. El orden —definir la proyección por la propiedad que la caracteriza y deducir la fórmula, en vez de dar la fórmula y comprobar la propiedad—, la insistencia en que el mínimo sale de Pitágoras y no de derivar, y la Proposición 5.9, que presenta el centrado de la estadística descriptiva como el caso más simple de proyección.
Índices verificados el 12-09-2026 contra el índice publicado del PDF oficial.
→ Siguiente: Mínimos cuadrados