Producto interno, norma y ángulo
Matemática · Lección 4
Objetivo
Al terminar esta lección se puede:
- Definir el producto interno y deducir de él la norma, la distancia y la ortogonalidad.
- Demostrar el teorema de Pitágoras en \mathbb{R}^n y la desigualdad de Cauchy-Schwarz, y con ella justificar que el ángulo entre dos vectores existe.
- Demostrar la desigualdad triangular como consecuencia de Cauchy-Schwarz.
- Demostrar que la correlación de Pearson es el coseno del ángulo entre dos variables centradas, y explicar por qué sin centrar la cuenta no mide asociación.
De dónde viene
- Matemática 1: los vectores de \mathbb{R}^n y sus dos operaciones, sumar y escalar. Hasta aquí el espacio no sabía medir nada: no había forma de decir que un vector es más largo que otro.
- Matemática 3: el espacio columna y la independencia lineal. Esta lección le pone longitud y ángulo a esos subespacios, que es lo que permitirá proyectar sobre ellos.
Para qué sirve después
- Matemática 5: la proyección ortogonal se define entera con el producto interno; el residuo perpendicular que aparece al final del primer visual es su objeto de estudio.
- Matemática 6: mínimos cuadrados es proyectar el vector de observaciones sobre el espacio columna, y la Proposición 4.4 —Pitágoras— es la que parte la suma de cuadrados en dos.
- Estadística 5: la correlación de Pearson y su rango [-1,1] salen de la Proposición 4.8 y de Cauchy-Schwarz, no de una convención.
- Estadística 12 y 13: la matriz de covarianza es una matriz de productos internos entre variables centradas, y la recta de regresión es la proyección de la lección 6.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| u, v | u, ve | Vectores de \mathbb{R}^n, escritos como columnas |
| \langle u, v\rangle | producto interno de u y v | u^\top v = \sum_{i=1}^n u_iv_i |
| \|u\| | norma de u | \sqrt{\langle u,u\rangle}, la longitud de u |
| \theta | theta | El ángulo entre dos vectores. Aquí es eso; en Estadística 8 es el parámetro a estimar |
| u \perp v | u perpendicular a v | \langle u,v\rangle = 0 |
| \tilde{x} | equis tilde | El vector x centrado: x_i - \bar{x} en cada posición |
| n | ene | La dimensión del espacio; en la sección 3, el número de observaciones |
1. La operación que trae la geometría
Un espacio vectorial, tal como quedó en la lección 1, solo sabe sumar vectores y multiplicarlos por números. No hay en esa estructura nada que permita decir que un vector es largo, ni que dos apuntan casi en la misma dirección. Todo eso entra con una sola operación.
Definición 4.1 (producto interno). Para u,v\in\mathbb{R}^n, \langle u, v\rangle \;=\; u^\top v \;=\; \sum_{i=1}^{n} u_i v_i. Cumple tres propiedades, que se comprueban directamente sobre la suma: es simétrico —\langle u,v\rangle = \langle v,u\rangle—, es lineal en cada argumento —\langle au+bw,\,v\rangle = a\langle u,v\rangle + b\langle w,v\rangle— y es definido positivo: \langle u,u\rangle = \sum_i u_i^2 \ge 0, con igualdad solo si u=0.
De las tres propiedades, la tercera es la que permite definir una longitud: si \langle u,u\rangle pudiera ser negativo, no habría raíz que sacar.
Definición 4.2 (norma y distancia). \|u\| = \sqrt{\langle u,u\rangle} = \sqrt{\sum_i u_i^2}, y la distancia entre dos vectores es \|u-v\|.
Definición 4.3 (ortogonalidad). u y v son ortogonales, escrito u\perp v, si \langle u,v\rangle = 0. El vector cero es ortogonal a todos.
La definición de ortogonalidad es puramente algebraica —una suma que da cero— y sin embargo tiene la consecuencia geométrica que todo el mundo asocia a la palabra «perpendicular».
Proposición 4.4 (Pitágoras en \mathbb{R}^n). \|u+v\|^2 = \|u\|^2 + \|v\|^2 si y solo si u\perp v.
Demostración. Expandiendo con bilinealidad y simetría (Definición 4.1), \|u+v\|^2 = \langle u+v,\,u+v\rangle = \langle u,u\rangle + 2\langle u,v\rangle + \langle v,v\rangle = \|u\|^2 + \|v\|^2 + 2\langle u,v\rangle. El término 2\langle u,v\rangle es exactamente la diferencia entre los dos lados de la igualdad buscada, así que esta se cumple si y solo si \langle u,v\rangle = 0, que es la Definición 4.3. ∎
Conviene notar lo que no hace falta para esta demostración: ni ángulos, ni triángulos, ni dibujos. Pitágoras en \mathbb{R}^n es una línea de álgebra sobre una suma. Es también la pieza que, en la lección 6, parte la suma total de cuadrados en la parte explicada y el residuo.
El primer visual muestra las tres definiciones a la vez sobre dos vectores del plano.
La barra de la derecha es el producto interno con su signo: positivo cuando los vectores apuntan hacia el mismo lado, cero cuando son perpendiculares —y ahí la sombra de v sobre u se reduce a un punto—, negativo cuando el ángulo pasa de los 90°. Esa sombra es la proyección de la lección 5, y la línea roja punteada es el residuo que queda al quitarla.
2. Cauchy-Schwarz, y por qué existe el ángulo
El coseno de un ángulo vive en [-1,1]. Si se quiere definir el ángulo entre dos vectores como el arcocoseno de \langle u,v\rangle/(\|u\|\|v\|), hay que demostrar primero que ese cociente no se sale del intervalo. Eso es Cauchy-Schwarz.
Proposición 4.5 (desigualdad de Cauchy-Schwarz). Para todos u,v\in\mathbb{R}^n, |\langle u,v\rangle| \;\le\; \|u\|\,\|v\|, con igualdad si y solo si uno de los dos es múltiplo del otro.
Demostración. Si v=0 los dos lados valen cero. Supóngase v\ne 0 y considérese, para cualquier t\in\mathbb{R}, el vector u-tv. Por ser el producto interno definido positivo (Definición 4.1), 0 \;\le\; \|u-tv\|^2 = \langle u-tv,\;u-tv\rangle = \|u\|^2 - 2t\langle u,v\rangle + t^2\|v\|^2, donde la expansión usa bilinealidad y simetría. El lado derecho es un polinomio de grado dos en t con coeficiente principal \|v\|^2>0: una parábola que abre hacia arriba y que, según acaba de verse, nunca baja de cero. Una parábola así corta al eje a lo sumo en un punto, de modo que su discriminante no es positivo. Con a=\|v\|^2, b=-2\langle u,v\rangle y c=\|u\|^2: b^2-4ac \le 0 \quad\Longrightarrow\quad 4\langle u,v\rangle^2 - 4\|u\|^2\|v\|^2 \le 0 \quad\Longrightarrow\quad \langle u,v\rangle^2 \le \|u\|^2\|v\|^2, y tomando raíz cuadrada queda la desigualdad. La igualdad se da exactamente cuando el discriminante es cero, es decir cuando la parábola toca el eje: existe entonces un t_0 con \|u-t_0v\|^2=0, y por definido positivo eso significa u=t_0v. ∎
Definición 4.6 (ángulo). Para u,v\ne 0, el ángulo entre ellos es el único \theta\in[0,\pi] con \cos\theta = \frac{\langle u,v\rangle}{\|u\|\,\|v\|}. La Proposición 4.5 garantiza que ese cociente está en [-1,1], así que el arcocoseno existe; y \theta=\pi/2 equivale a \langle u,v\rangle=0, que es la Definición 4.3.
Nótese el orden: la ortogonalidad se definió antes que el ángulo y sin mencionarlo, y solo ahora se comprueba que las dos ideas coinciden. Es al revés de como se aprende en la escuela, y es lo que permite que todo esto funcione en \mathbb{R}^{1000}, donde no hay transportador.
Proposición 4.7 (desigualdad triangular). \|u+v\| \le \|u\| + \|v\|, con igualdad si y solo si uno de los dos es un múltiplo no negativo del otro.
Demostración. Partiendo de la expansión de la Proposición 4.4 y acotando el término cruzado con Cauchy-Schwarz, \|u+v\|^2 = \|u\|^2 + 2\langle u,v\rangle + \|v\|^2 \;\le\; \|u\|^2 + 2\|u\|\|v\| + \|v\|^2 = \big(\|u\|+\|v\|\big)^2. Como las dos cantidades son no negativas, la raíz cuadrada conserva la desigualdad. La igualdad exige dos cosas a la vez: que Cauchy-Schwarz sea igualdad —esto es, u=t_0v— y que además \langle u,v\rangle = +\|u\|\|v\|, lo que fuerza t_0\ge 0. ∎
La celda comprueba las dos desigualdades sobre vectores sorteados y sobre sus casos de igualdad.
Las dos últimas líneas separan los dos casos de igualdad, que no son el mismo: con v=-2{,}7u Cauchy-Schwarz sigue siendo igualdad —porque toma valor absoluto— pero la triangular ya no, y le sobran 3,64 unidades. Por eso la Proposición 4.7 pide múltiplo no negativo y la 4.5 no.
3. La correlación es un coseno
La lección 5 de Estadística define la correlación de Pearson entre dos variables x e y medidas sobre las mismas n unidades: r = \frac{\sum_i (x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\sum_i (x_i-\bar{x})^2}\,\sqrt{\sum_i (y_i-\bar{y})^2}}. Puesto al lado de la Definición 4.6, el parecido no es casual.
Proposición 4.8 (Pearson es un coseno). Sean x,y\in\mathbb{R}^n dos variables medidas sobre las mismas n unidades, y sean \tilde{x} e \tilde{y} sus versiones centradas, \tilde{x}_i = x_i-\bar{x}. Entonces r(x,y) \;=\; \frac{\langle \tilde{x},\tilde{y}\rangle}{\|\tilde{x}\|\,\|\tilde{y}\|} \;=\; \cos\theta, donde \theta es el ángulo entre \tilde{x} e \tilde{y}. En consecuencia -1\le r\le 1, y r=0 equivale a \tilde{x}\perp\tilde{y}.
Demostración. Es reescribir cada pieza. El numerador de r es \sum_i \tilde{x}_i\tilde{y}_i = \langle\tilde{x},\tilde{y}\rangle por la Definición 4.1. Cada raíz del denominador es \sqrt{\sum_i\tilde{x}_i^2} = \|\tilde{x}\| por la Definición 4.2. Sustituyendo, r es el cociente de la Definición 4.6, es decir \cos\theta. El rango sale de la Proposición 4.5: |\langle\tilde{x},\tilde{y}\rangle|\le\|\tilde{x}\|\|\tilde{y}\| implica |r|\le 1. Y r=0 equivale a \langle\tilde{x},\tilde{y}\rangle=0, que es la Definición 4.3. ∎
Las dos expresiones son la misma cuenta escrita en dos notaciones. Y explica de paso tres cosas que en Estadística suelen presentarse como reglas sueltas: que la correlación viva entre -1 y 1 (Cauchy-Schwarz), que no tenga unidades (el cociente las cancela) y que no cambie al multiplicar una variable por una constante positiva (escalar un vector no mueve su dirección).
El paso que no se puede saltar es el centrado, y el visual muestra por qué.
Sin centrar, el coseno da 0,97 con seis observaciones y 0,996 con quinientas, mientras las correlaciones verdaderas son 0,70 y 0,51. La razón es geométrica: si todas las entradas de los dos vectores son positivas —y los pesos y las semanas lo son—, los dos apuntan hacia el mismo octante del espacio y el ángulo entre ellos es forzosamente pequeño. Lo que mide ese coseno es «ambas variables son positivas», no que covaríen.
Centrar mueve el origen al centro de la nube: los dos vectores centrados son ortogonales al vector de unos, viven en el hiperplano de suma cero, y ahí el ángulo ya mide covariación. Es la misma razón por la que el análisis de componentes principales centra los datos antes de buscar direcciones, y por la que la lección 5 de Estadística insiste en restar la media antes de nada.
Ejercicios
Ejercicio 1 — El ángulo entre dos vectores
Calcular el ángulo en grados entre dos vectores, usando la Definición 4.6.
\cos\theta = \dfrac{u^\top v}{\|u\|\|v\|}. En NumPy el producto interno es u @ v y la norma es np.linalg.norm(u).
Ejercicio 2 — La correlación desde cero
Implementar la correlación de Pearson usando solo producto interno y norma, sin np.corrcoef, siguiendo la Proposición 4.8.
Centra ambos vectores restándoles su media, y después calcula el coseno del ángulo entre ellos: producto interno dividido entre el producto de las normas.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Mat 4:
- Añadir
correlacion(x, y)ascratch/lineal.py, escrita con producto interno y norma, con una prueba contranp.corrcoefa tolerancia 10^{-12} sobre mil pares aleatorios. Incluir el caso degenerado de varianza cero: ¿qué debería devolver, y qué devuelve NumPy? - El ángulo entre vectores aleatorios en dimensión alta. Sortear dos vectores de \mathbb{R}^n con n\in\{2,10,100,1000,10^4\}, medir el ángulo entre ellos y repetir quinientas veces por dimensión. Graficar la distribución del ángulo. Casi todos los pares salen casi ortogonales, y la dispersión se encoge como 1/\sqrt{n}: es el fenómeno de concentración, y es una de las razones por las que los métodos basados en distancias se degradan con muchas variables.
- Comprobar numéricamente que centrar un vector equivale a proyectarlo sobre el complemento ortogonal del vector de unos: \tilde{x} = x - \frac{\langle x,\mathbf{1}\rangle}{\langle \mathbf{1},\mathbf{1}\rangle}\mathbf{1}. Esa fórmula es la lección 5 entera, aplicada al caso más simple.
Del libro
Mathematics for Machine Learning dedica cuatro secciones seguidas a este material: §3.1 Norms, §3.2 Inner Products, §3.3 Lengths and Distances y §3.4 Angles and Orthogonality; §3.7 Inner Product of Functions lleva la misma definición a espacios de funciones.
El libro tiene copyright y no se puede descargar desde el entorno en el que se escribió esta página, así que aquí se cita número y título de sección y no se le atribuye ninguna frase. El orden de MML es además distinto del de esta lección: define primero la norma en general y después el producto interno, mientras que aquí se hace al revés, para que la norma salga como consecuencia.
Preguntas para leer §3.1–3.4 con lápiz:
- MML define el producto interno en general, no solo el de la Definición 4.1. ¿Qué tres condiciones exige, y cuál de ellas es la que aquí permitió definir la norma?
- El libro trata la norma L_1 además de la euclídea. ¿Sale esa norma de algún producto interno? ¿Qué le pasa a la Proposición 4.4 si se usa L_1 en vez de L_2?
- §3.7 aplica la misma definición a funciones, con una integral en lugar de una suma. ¿Qué habría que comprobar para que las tres propiedades de la Definición 4.1 sigan valiendo?
Para el Cerebro
Nota nueva en 10-Conceptos/producto-interno.md, enlazada a [[espacio-columna]], [[proyeccion-ortogonal]] y [[correlacion]]. La Proposición 4.8 conviene rehacerla a mano una vez: es media página y deja unidas por un puente sólido la mitad de Matemática y la mitad de Estadística.
¿Qué es el producto interno de dos vectores?::La suma de los productos componente a componente: ⟨u,v⟩ = uᵀv
¿Qué tres propiedades cumple?::Simetría, linealidad en cada argumento y definido positivo
¿De cuál de ellas sale la norma?::De ser definido positivo: ⟨u,u⟩ ≥ 0 permite sacar la raíz
¿Qué significa ⟨u,v⟩ = 0?::Que son ortogonales: ninguna parte de v va en la dirección de u
Enuncia Pitágoras en Rⁿ::‖u+v‖² = ‖u‖² + ‖v‖² si y solo si ⟨u,v⟩ = 0 (Proposición 4.4)
¿Qué dice Cauchy-Schwarz?::|⟨u,v⟩| ≤ ‖u‖‖v‖, con igualdad solo si uno es múltiplo del otro
¿Cómo se demuestra?::‖u − tv‖² ≥ 0 es una parábola en t que no baja de cero, así que su discriminante es ≤ 0
¿Para qué hace falta Cauchy-Schwarz?::Para que el coseno esté en [−1,1] y el ángulo de la Definición 4.6 exista
¿Qué exige la igualdad en la desigualdad triangular?::Que uno sea múltiplo NO NEGATIVO del otro; en Cauchy-Schwarz basta con que sea múltiplo
¿Qué relación hay entre correlación de Pearson y coseno?::Son lo mismo: r es el coseno del ángulo entre las variables centradas (Proposición 4.8)
¿Por qué la correlación vive en [−1,1]?::Por Cauchy-Schwarz aplicada a los vectores centrados
¿Por qué hay que centrar antes de calcular el coseno?::Sin centrar, dos variables positivas apuntan al mismo octante y el coseno sale cerca de 1 aunque no covaríen
¿Qué le pasa a los ángulos entre vectores aleatorios cuando n crece?::Se concentran en 90°: casi todo par es casi ortogonal
Fuentes
Lo que esta página demuestra sola. Todo lo enunciado: la Proposición 4.4 (Pitágoras), la 4.5 (Cauchy-Schwarz), la 4.7 (desigualdad triangular) y la 4.8 (Pearson es un coseno) se demuestran aquí, a partir únicamente de la Definición 4.1 y sus tres propiedades. Se comprueban además numéricamente: las dos desigualdades sobre 20 000 pares de vectores de \mathbb{R}^6, sus dos casos de igualdad —que no coinciden—, y la identidad entre el coseno de las variables centradas y np.corrcoef, con diferencia exactamente cero en 500 observaciones. Los dos visuales se contrastaron antes de publicarse: 4 casos × 180 direcciones × 26 longitudes para el primero, y 19 correlaciones × 2 estados del centrado para el segundo, con el segundo construyendo la variable de respuesta por la misma descomposición que la lección explica, de modo que la correlación buscada se alcanza exactamente.
Lo que se usa de otras lecciones sin repetir. Los vectores de \mathbb{R}^n y sus operaciones son la lección 1; el espacio columna y la independencia lineal, la lección 3. La definición de correlación que se contrasta en la Proposición 4.8 es la de Estadística 5.
Lo que se enuncia sin demostrar. Nada.
Lo que viene de los libros.
- Mathematics for Machine Learning (Deisenroth, Faisal & Ong, Cambridge University Press, 2020), §3.1 Norms, §3.2 Inner Products, §3.3 Lengths and Distances, §3.4 Angles and Orthogonality y §3.7 Inner Product of Functions — citadas por número y título. El libro tiene copyright y no es descargable desde este entorno, así que no se transcribe ninguna frase y las preguntas de lectura piden comparar lo que el libro hace con lo que esta página demuestra, sin poner palabras en boca de nadie.
Lo que es mío, no del libro. La numeración y el orden de presentación —producto interno primero, norma como consecuencia, ortogonalidad antes que ángulo—, que es el inverso del de MML y está elegido para que nada dependa de dibujos. El puente de la Proposición 4.8, que MML no plantea: el libro trata la geometría y deja la correlación a los capítulos de estadística.
Índices verificados el 12-09-2026 contra el índice publicado del PDF oficial.
→ Siguiente: Proyección ortogonal