Eigenvalores: las direcciones que no giran
Matemática · Lección 9
Objetivo
Al terminar esta lección se puede:
- Definir eigenvector y eigenvalor y decir qué pregunta geométrica responden.
- Demostrar que \lambda es eigenvalor si y solo si \det(A-\lambda I) = 0, y deducir el polinomio característico.
- Demostrar que para una matriz 2\times 2 la suma de los eigenvalores es la traza y su producto el determinante.
- Demostrar que una matriz simétrica tiene eigenvalores reales y eigenvectores perpendiculares, y explicar por qué eso importa.
De dónde viene
- Lección 8: la Proposición 8.4 —\det(A)=0 exactamente cuando las columnas son dependientes— es el único ingrediente de la Proposición 9.2, que es la que convierte la definición en algo calculable.
- Lección 4: el producto interno y la perpendicularidad. Toda la sección 4 está escrita en ese lenguaje.
- Lección 2: una matriz es una transformación. La pregunta de esta lección solo tiene sentido si se lee así: ¿qué le hace la transformación a cada dirección?
Para qué sirve después
- Lección 10: diagonalizar es escribir A = PDP^{-1} con los eigenvectores en P. Calcular A^{k} pasa a ser elevar números a la k.
- Lección 11: los valores singulares son las raíces de los eigenvalores de A^{\mathsf{T}}A, que es simétrica, y por eso la Proposición 9.8 los hace manejables.
- Lección 12: una forma cuadrática es definida positiva exactamente cuando todos sus eigenvalores son positivos.
- Estadística 12: la matriz de covarianza es simétrica; sus eigenvectores son los ejes de la elipse de dispersión, y sus eigenvalores, las varianzas a lo largo de esos ejes. La Proposición 9.8 es lo que hace que esa frase tenga sentido.
- Aprendizaje automático: componentes principales, espectros de grafos y la estabilidad del entrenamiento se leen todos en eigenvalores.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| \lambda | lambda | Un eigenvalor: el factor por el que se estira una dirección propia |
| v | v | Un eigenvector: una dirección que la matriz no gira. Nunca el vector cero |
| I | i | La matriz identidad |
| A - \lambda I | La matriz A con \lambda restado a cada entrada de la diagonal, y solo ahí | |
| p(\lambda) | pe de lambda | El polinomio característico, \det(A-\lambda I) |
| \text{tr}(A) | traza de a | La suma de la diagonal, a+d en el caso 2\times 2 |
| A^{\mathsf{T}} | a traspuesta | La matriz con filas y columnas intercambiadas |
Cuidado con A - \lambda I: no es restarle \lambda a todas las entradas. La identidad tiene ceros fuera de la diagonal, así que \lambda I solo toca la diagonal: A - \lambda I = \begin{pmatrix} a-\lambda & b \\ c & d-\lambda\end{pmatrix}.
1. La pregunta
Una matriz transforma el plano (Proposición 2.4): cada vector se va a otro sitio, en general girado y estirado. La pregunta de esta lección es qué direcciones sobreviven al giro.
Definición 9.1 (eigenvector y eigenvalor). Un vector v \ne 0 es un eigenvector de A si existe un escalar \lambda con Av = \lambda v. A ese \lambda se le llama el eigenvalor asociado a v.
La condición v \ne 0 no es un tecnicismo: A\,0 = 0 = \lambda\,0 para todo \lambda, así que admitir el cero haría que cualquier número fuese eigenvalor y la definición no diría nada.
Lo que sí puede valer cero es \lambda. Si Av = 0 con v \ne 0, entonces v es un eigenvector de eigenvalor cero, y eso significa que A aplasta esa dirección hasta el origen: por la Proposición 8.4, \det(A) = 0.
Recorriendo el círculo con el control, la flecha naranja casi siempre apunta a otro sitio que la verde. Las rectas punteadas marcan las pocas direcciones donde las dos se alinean, y el botón lleva v justo ahí. Los cinco casos del menú son los cinco comportamientos posibles de una matriz 2\times 2:
| Matriz | Qué pasa |
|---|---|
| estiramiento | dos direcciones propias, que son los ejes |
| simétrica | dos direcciones propias, perpendiculares entre sí |
| no simétrica | dos direcciones propias, pero no perpendiculares |
| cizalla | eigenvalor repetido y una sola dirección propia |
| rotación | ninguna dirección propia real |
Las secciones que siguen explican de dónde salen exactamente esos cinco casos y por qué no hay un sexto.
2. Cómo se calculan
La Definición 9.1 dice qué es un eigenvalor, no cómo encontrarlo: buscar a mano las direcciones que se alinean no es un método. La proposición siguiente lo convierte en una ecuación.
Proposición 9.2. \lambda es un eigenvalor de A si y solo si \det(A - \lambda I) = 0.
Demostración. La ecuación Av = \lambda v se puede escribir como Av - \lambda v = 0, y como \lambda v = \lambda I v, eso es (A - \lambda I)\,v = 0. Ahora bien, decir que existe algún v \ne 0 con (A-\lambda I)v = 0 es decir que la matriz A-\lambda I manda un vector no nulo al cero, es decir, que no es inyectiva y por tanto no tiene inversa. Por la Proposición 8.4, eso ocurre exactamente cuando su determinante es cero.
Y al revés: si \det(A-\lambda I) = 0, la Proposición 8.4 dice que sus columnas son dependientes, así que existe una combinación no trivial de ellas que da cero; los coeficientes de esa combinación forman un v \ne 0 con (A-\lambda I)v = 0, que es un eigenvector. ∎
Esa es la razón de que la lección 8 tuviera que ir antes: sin determinante no hay manera de escribir la condición.
Definición 9.3 (polinomio característico). p(\lambda) = \det(A - \lambda I).
Proposición 9.4. Para una matriz 2\times 2, p(\lambda) = \lambda^2 - \text{tr}(A)\,\lambda + \det(A), donde \text{tr}(A) = a+d.
Demostración. Aplicando la Definición 8.1 a A-\lambda I: p(\lambda) = (a-\lambda)(d-\lambda) - bc = ad - a\lambda - d\lambda + \lambda^2 - bc = \lambda^2 - (a+d)\lambda + (ad-bc), donde se ha agrupado \lambda^2, los términos en \lambda y los constantes. El coeficiente de \lambda es -(a+d) = -\text{tr}(A) y el término independiente es ad-bc = \det(A). ∎
El resultado es notable por lo que no contiene: b y c solo aparecen a través del producto bc. Dos matrices con la misma traza y el mismo determinante tienen exactamente los mismos eigenvalores, por distintas que sean sus entradas.
Proposición 9.5. Si A es 2\times 2 y \lambda_1, \lambda_2 son las raíces de p, entonces \lambda_1 + \lambda_2 = \text{tr}(A), \qquad \lambda_1\lambda_2 = \det(A).
Demostración. Un polinomio mónico de segundo grado con raíces \lambda_1 y \lambda_2 se factoriza como (\lambda-\lambda_1)(\lambda-\lambda_2). Desarrollando, (\lambda-\lambda_1)(\lambda-\lambda_2) = \lambda^2 - (\lambda_1+\lambda_2)\lambda + \lambda_1\lambda_2. Comparando coeficiente a coeficiente con la Proposición 9.4 —dos polinomios son iguales si y solo si lo son sus coeficientes— se obtienen las dos identidades. ∎
Son dos cantidades gratis: traza y determinante se leen de la matriz sin resolver nada, y dan la suma y el producto de los eigenvalores antes de calcularlos. Sirven además de comprobación: si un cálculo da eigenvalores cuya suma no es la traza, el cálculo está mal.
Como el polinomio es de segundo grado con coeficiente principal positivo, su gráfica es una parábola hacia arriba, y las raíces son donde corta el eje. El visual deja mover traza y determinante por separado, y ahí se ve lo que la fórmula esconde: el vértice está siempre en \lambda = \text{tr}(A)/2, así que el determinante levanta o baja la parábola sin desplazarla. Pasar de dos raíces a ninguna es cuestión de altura.
El umbral es el discriminante \text{tr}^2 - 4\det:
- positivo: dos eigenvalores reales distintos;
- cero: uno repetido, y puede haber una sola dirección propia;
- negativo: ninguno real, y la matriz gira.
Proposición 9.6. Una rotación de ángulo \theta no tiene eigenvalores reales, salvo si \theta es múltiplo de 180°.
Demostración. La matriz de rotación es R = \begin{pmatrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta\end{pmatrix}, con \text{tr}(R) = 2\cos\theta y \det(R) = \cos^2\theta + \sin^2\theta = 1. Su discriminante vale 4\cos^2\theta - 4 = -4\sin^2\theta \le 0, y es cero solo cuando \sin\theta = 0, es decir, cuando \theta es múltiplo de 180°. Fuera de esos casos es estrictamente negativo y no hay raíces reales. ∎
Geométricamente es obvio —una rotación no deja ninguna dirección quieta— y ahí está el interés: el discriminante detecta esa obviedad a partir de cuatro números, sin dibujar nada.
3. Por qué las matrices simétricas son especiales
Casi todas las matrices que aparecen en estadística y en aprendizaje automático son simétricas: matrices de covarianza, matrices de Gram A^{\mathsf{T}}A, hessianas. No es coincidencia —todas nacen de un producto interno— y tienen dos propiedades que las matrices generales no tienen.
Definición 9.7 (matriz simétrica). A es simétrica si A^{\mathsf{T}} = A, es decir, si a_{ij} = a_{ji} para todo par de índices. En 2\times 2: b = c.
Proposición 9.8. Sea A una matriz simétrica real 2\times 2. Entonces:
- Sus dos eigenvalores son reales.
- Si son distintos, sus eigenvectores son perpendiculares.
Demostración. (1) Con A = \begin{pmatrix} a & b \\ b & d\end{pmatrix}, el discriminante de la Proposición 9.4 vale \text{tr}^2 - 4\det = (a+d)^2 - 4(ad - b^2) = a^2 + 2ad + d^2 - 4ad + 4b^2 = (a-d)^2 + 4b^2, suma de dos cuadrados y por tanto \ge 0. Nunca es negativo, así que las raíces nunca son complejas. Además es cero solo si a = d y b = 0, es decir, solo si A es un múltiplo de la identidad —el único caso simétrico con eigenvalor repetido, y ahí toda dirección es propia—.
(2) Sean Av_1 = \lambda_1 v_1 y Av_2 = \lambda_2 v_2 con \lambda_1 \ne \lambda_2. La clave es que para una matriz simétrica, \langle Au, w\rangle = \langle u, Aw\rangle \quad\text{para todos } u, w, porque \langle Au, w\rangle = (Au)^{\mathsf{T}}w = u^{\mathsf{T}}A^{\mathsf{T}}w = u^{\mathsf{T}}Aw = \langle u, Aw\rangle, donde el paso central usa A^{\mathsf{T}} = A. Aplicándolo a u = v_1, w = v_2: \lambda_1\langle v_1, v_2\rangle = \langle Av_1, v_2\rangle = \langle v_1, Av_2\rangle = \lambda_2\langle v_1, v_2\rangle, donde los escalares salen fuera por la bilinealidad del producto interno (Proposición 4.2). Pasando todo a un lado, (\lambda_1-\lambda_2)\,\langle v_1, v_2\rangle = 0, y como \lambda_1 \ne \lambda_2 el primer factor no es cero, luego \langle v_1, v_2\rangle = 0: los dos eigenvectores son perpendiculares por la Definición 4.9. ∎
La demostración de (2) no usa en ningún momento que la matriz sea 2\times 2: vale palabra por palabra en cualquier dimensión. Lo que sí es especial del caso pequeño es (1), donde el discriminante se pudo escribir a mano; en dimensión n el resultado sigue siendo cierto —es el teorema espectral— pero la demostración necesita otras herramientas.
El círculo unidad se convierte en una elipse, y la pregunta es dónde quedan sus ejes. Con una matriz simétrica caen exactamente sobre las eigendirecciones, que forman 90°; con una no simétrica, ni lo uno ni lo otro. La simetría es lo que regala el ángulo recto.
Eso es lo que se usará en la lección 12 de estadística. La matriz de covarianza \Sigma es simétrica por construcción —\text{Cov}(X,Y) = \text{Cov}(Y,X), que es la Proposición 5.2—, así que sus eigenvectores son perpendiculares y sirven como sistema de ejes: girando los datos hasta alinearlos con ellos, las variables quedan descorrelacionadas y cada eigenvalor es la varianza a lo largo de su eje. Sin la Proposición 9.8 esa frase no significaría nada, porque unos ejes no perpendiculares no sirven para medir.
Ejercicios
Ejercicio 1 — Traza y determinante como atajo
Comprobar la Proposición 9.5 sobre 300 matrices 2\times 2 aleatorias que tengan eigenvalores reales. Devolver el mayor error absoluto entre la suma de los eigenvalores y la traza.
La traza es np.trace(A) y el determinante np.linalg.det(A). La suma de los eigenvalores es w.sum() y su producto w.prod(). Se devuelven los dos errores absolutos como una tupla.
err_suma, err_prod = abs(w.sum() - np.trace(A)), abs(w.prod() - np.linalg.det(A))El error queda en el orden de 10^{-14}: es punto flotante, no una discrepancia. Nótese además cuántas se descartan: de 300 matrices con entradas normales, unas 220 tienen eigenvalores reales y el resto no. Tener eigenvalores complejos no es un caso raro.
Ejercicio 2 — El ángulo recto es de la simetría
Comparar el ángulo entre eigenvectores de matrices simétricas y de matrices cualesquiera. Devolver el mayor producto interno absoluto entre eigenvectores distintos de las simétricas.
La matriz de todos los productos internos entre las columnas de Vs es Vs.T @ Vs. Si son perpendiculares y de norma 1, eso es la identidad. La medida del alejamiento es np.abs(... - np.eye(4)).max().
fuera_sim = np.abs(Vs.T @ Vs - np.eye(4)).max()Las simétricas se quedan en el orden de 10^{-15} —perpendiculares hasta el último bit— mientras que las generales se apartan en cantidades del orden de la unidad. Esa diferencia de quince órdenes de magnitud es la Proposición 9.8.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Mat 09:
- Escribir
eig2x2(A)que devuelva eigenvalores y eigenvectores de una 2\times 2 resolviendo el polinomio característico a mano, incluyendo el caso complejo y el de eigenvalor repetido. Probarla contranp.linalg.eigsobre mil matrices aleatorias y localizar dónde falla el caso repetido. - El método de la potencia encuentra el eigenvalor de mayor módulo sin resolver ningún polinomio: se parte de un vector al azar y se multiplica por A repetidamente, normalizando. Implementarlo y graficar cómo converge el cociente \|Av\|/\|v\| para matrices con eigenvalores (3, 1), (3, 2{,}9) y (3, -3). Explicar los tres comportamientos a partir del cociente |\lambda_2/\lambda_1|.
- Tomar una foto en escala de grises como matriz, calcular los eigenvalores de A^{\mathsf{T}}A y reconstruir la imagen usando solo los k mayores, para varios k. Medir el error de reconstrucción frente a k. Esto es la lección 11 adelantada; conviene hacerlo antes de leerla.
Del libro
Mathematics for Machine Learning trata este material en MML §4.2 Eigenvalues and Eigenvectors, y la aplicación que motiva la lección 12 de estadística está en MML §4.4 Eigendecomposition and Diagonalization.
No se cita texto de MML porque no se pudo extraer su contenido de forma verificable al escribir esta página: solo se comprobaron los números y títulos de sección contra el índice del PDF oficial. Los enunciados y demostraciones de arriba están escritos aquí y no reproducen los del libro; pueden diferir en notación y en el orden de los pasos.
Preguntas para leer §4.2 con lápiz:
- El libro define el espacio propio (eigenspace) asociado a un eigenvalor. ¿Qué añade eso a la Definición 9.1 de aquí, y qué caso de la tabla de la sección 1 obliga a introducirlo?
- Aparece también la multiplicidad algebraica frente a la geométrica. Localizar cuál de los cinco casos de la sección 1 tiene las dos distintas, y comprobar que coincide con el que aquí se describe como «una sola dirección propia».
- §4.2 antecede a §4.4 Eigendecomposition and Diagonalization. Antes de leerla: con los eigenvectores en las columnas de una matriz P, ¿qué tiene que pasar para que P sea invertible, y qué caso de la tabla lo impide?
Para el Cerebro
Nota nueva en 10-Conceptos/eigenvalores.md, enlazada a [[determinante]], [[producto-interno]] y [[matriz-como-transformacion]]. La demostración de la Proposición 9.8 apartado (2) conviene copiarla entera: cabe en tres líneas y es la que sostiene componentes principales, covarianza y todo lo que venga después.
¿Qué es un eigenvector?::Un vector no nulo v tal que Av = λv: la matriz no lo gira, solo lo estira
¿Por qué se excluye el vector cero?::Porque A0 = λ0 para todo λ, y admitirlo haría que cualquier número fuera eigenvalor
¿Qué significa un eigenvalor cero?::Que la matriz aplasta esa dirección hasta el origen. Implica det(A) = 0
¿Cómo se calculan los eigenvalores?::Resolviendo det(A − λI) = 0
¿Por qué esa ecuación?::Porque Av = λv equivale a (A − λI)v = 0 con v ≠ 0, y eso pide que A − λI no tenga inversa
¿Qué es A − λI?::Restar λ solo a la diagonal, no a todas las entradas
¿Cuál es el polinomio característico de una 2×2?::λ² − tr(A)λ + det(A)
¿Cuánto vale la suma de los eigenvalores?::La traza. Y su producto, el determinante
¿Para qué sirve eso en la práctica?::Como comprobación: si la suma de los eigenvalores calculados no da la traza, el cálculo está mal
¿Qué decide si los eigenvalores son reales?::El discriminante tr² − 4det. Positivo: dos reales; cero: uno repetido; negativo: ninguno real
¿Dónde está el vértice de la parábola característica?::Siempre en λ = tr/2. El determinante la sube o la baja sin moverla
¿Tiene eigenvalores reales una rotación?::No, salvo giros de 0° o 180°. Su discriminante vale −4sen²θ
¿Qué tienen de especial las matrices simétricas?::Sus eigenvalores son reales y sus eigenvectores perpendiculares
¿Por qué son reales?::Porque su discriminante es (a−d)² + 4b², suma de cuadrados
¿Por qué son perpendiculares?::De ⟨Av₁,v₂⟩ = ⟨v₁,Av₂⟩ sale (λ₁−λ₂)⟨v₁,v₂⟩ = 0, y si los eigenvalores difieren el producto interno es cero
¿Dónde se usa eso?::En la matriz de covarianza, que es simétrica: sus eigenvectores son los ejes de la elipse de dispersión y sus eigenvalores las varianzas en esos ejes
Fuentes
Lo que esta página demuestra sola. Las Proposiciones 9.2, 9.4, 9.5, 9.6 y 9.8 se demuestran aquí, a partir de la Proposición 8.4 (determinante cero e inversa), la Definición 8.1, la Proposición 4.2 (bilinealidad del producto interno) y la Definición 4.9 (perpendicularidad). Las identidades de la Proposición 9.5 se verifican además con assert en la celda de la sección 2, y la Proposición 9.8 se comprueba sobre matrices simétricas 6\times 6 aleatorias en la de la sección 3. Los tres visuales se contrastaron contra numpy.linalg.eig antes de publicarse.
Lo que se enuncia sin demostrar. El teorema espectral en dimensión n: que toda matriz simétrica real tiene n eigenvalores reales y una base ortonormal de eigenvectores. Aquí se demuestra el apartado (2) en cualquier dimensión —la demostración no usa el tamaño— pero el apartado (1) solo para 2\times 2, donde el discriminante se puede escribir a mano.
Lo que viene de los libros.
- Mathematics for Machine Learning (Deisenroth, Faisal & Ong), §4.2 Eigenvalues and Eigenvectors y §4.4 Eigendecomposition and Diagonalization — referenciadas por número y título verificados contra el índice del PDF oficial. No se cita texto suyo: no se pudo extraer su contenido de forma verificable.
Lo que es mío, no del libro. La numeración de definiciones y proposiciones. La tabla de los cinco casos de la sección 1 como armazón de la lección, la lectura del vértice de la parábola en \text{tr}/2, y el encuadre de la Proposición 9.8 como «la simetría es lo que regala el ángulo recto» con su cobro en la lección 12 de estadística, son forma de presentarlo.
Índices verificados el 12-09-2026 contra el índice publicado del libro.
→ Siguiente: Diagonalización y potencia iterada