Formas cuadráticas y definición positiva

Álgebra · Lección 12

L2 Derivación Fase F1 Libro MML §3.2 · §4.3 Prereqs Diagonalización · Producto interno

Objetivo

Al terminar esta lección se puede:

  1. Definir una forma cuadrática y demostrar que basta con matrices simétricas para representarlas todas.
  2. Demostrar el criterio espectral: una matriz simétrica es definida positiva si y solo si todos sus eigenvalores son positivos, y que el mínimo de la forma sobre el círculo unitario es el menor eigenvalor.
  3. Leer las curvas de nivel (elipse, hipérbola o par de rectas) a partir de los signos de los eigenvalores.
  4. Demostrar que A^\top A es siempre semidefinida positiva, y definida cuando el rango es completo, y construir la factorización de Cholesky como certificado de definición positiva.

De dónde viene

  • Álgebra 10: la diagonalización ortogonal de una matriz simétrica, A=Q\Lambda Q^\top. Toda esta lección es esa factorización leída dentro de una forma cuadrática.
  • Álgebra 4: el producto interno, y la propiedad de ser definido positivo, que aquí se generaliza: \langle x,y\rangle_A = x^\top A y es un producto interno exactamente cuando A es definida positiva.
  • Álgebra 6 y 11: v^\top A^\top Av=\|Av\|^2 apareció al demostrar la unicidad de mínimos cuadrados y la existencia de la descomposición en valores singulares; aquí recibe su nombre.

Para qué sirve después

  • Álgebra 14 a 17: la Hessiana es una matriz simétrica, y que sea definida positiva es exactamente la condición de mínimo local, de convexidad local y de que el método de Newton apunte hacia abajo.
  • Estadística 12: una matriz de covarianza es semidefinida positiva siempre, y sus curvas de nivel son las elipses de la normal multivariante.
  • Simulación: para sortear de una normal multivariante se necesita una «raíz cuadrada» de \Sigma, y Cholesky la da.

Notación

Símbolo Se lee Significado
q(x) q de equis La forma cuadrática x^\top A x
A A Matriz simétrica n\times n salvo aviso
\lambda_1\ge\dots\ge\lambda_n lambdas Sus eigenvalores, todos reales por ser simétrica
Q cu La matriz ortogonal de sus eigenvectores
A\succ 0 A definida positiva x^\top Ax>0 para todo x\ne0
A\succeq 0 A semidefinida positiva x^\top Ax\ge0 para todo x
L ele El factor triangular inferior de Cholesky, A=LL^\top

1. Solo hacen falta matrices simétricas

Definición 12.1 (forma cuadrática). Dada A\in\mathbb{R}^{n\times n}, la función q(x)=x^\top Ax=\sum_{i,j}a_{ij}x_ix_j es una forma cuadrática: un polinomio homogéneo de grado dos en las coordenadas de x.

Proposición 12.2 (la parte antisimétrica no aporta). Para toda A y todo x, x^\top Ax = x^\top S x, \qquad S=\tfrac{1}{2}(A+A^\top), de modo que toda forma cuadrática se puede escribir con una matriz simétrica, y esa matriz es única.

Demostración. x^\top Ax es un número, luego coincide con su traspuesta: x^\top Ax = (x^\top Ax)^\top = x^\top A^\top x. Promediando las dos expresiones, x^\top Ax = \tfrac{1}{2}\big(x^\top Ax + x^\top A^\top x\big) = x^\top\Big(\tfrac{A+A^\top}{2}\Big)x. Para la unicidad: si S y S' simétricas dan la misma forma, entonces x^\top(S-S')x=0 para todo x; tomando x=e_i salen las diagonales iguales y tomando x=e_i+e_j salen las entradas (i,j) iguales.

Por eso, y sin pérdida de generalidad, de aquí en adelante A es simétrica. La ventaja es inmediata: la lección 10 garantiza que tiene eigenvalores reales y una base ortonormal de eigenvectores.

2. El signo de la forma es el signo de los eigenvalores

Definición 12.3. Una matriz simétrica A es definida positiva si x^\top Ax>0 para todo x\ne0; semidefinida positiva si x^\top Ax\ge0 para todo x; indefinida si toma valores de los dos signos.

Proposición 12.4 (criterio espectral). Sea A simétrica con eigenvalores \lambda_1\ge\dots\ge\lambda_n. Entonces:

  1. A es definida positiva si y solo si \lambda_n>0; semidefinida positiva si y solo si \lambda_n\ge0; indefinida si y solo si \lambda_1>0>\lambda_n;
  2. sobre el círculo unitario, \min_{\|x\|=1}x^\top Ax = \lambda_n y \max_{\|x\|=1}x^\top Ax=\lambda_1.

Demostración. Por la Proposición 10.4, A=Q\Lambda Q^\top con Q ortogonal. Escribiendo y=Q^\top x (que es una rotación, luego \|y\|=\|x\|), x^\top Ax = x^\top Q\Lambda Q^\top x = y^\top\Lambda y = \sum_{i=1}^{n}\lambda_i\,y_i^2. \tag{$\ast$} La forma es, en la base propia, una suma de cuadrados con pesos los eigenvalores. Si todos los \lambda_i>0, la suma es positiva salvo si todos los y_i son cero, es decir salvo si x=0; y si algún \lambda_j\le0, tomando x=q_j se obtiene x^\top Ax=\lambda_j\le0. Eso prueba (1) en sus tres versiones.

Para (2), con \|y\|=1 la expresión (\ast) es un promedio ponderado de los \lambda_i con pesos y_i^2 que suman uno, así que está entre el menor y el mayor; y los extremos se alcanzan en y=e_n y y=e_1, es decir en los eigenvectores correspondientes.

La identidad (\ast) es la lección entera: en la base propia, toda forma cuadrática es una suma de cuadrados con pesos. De ahí salen a la vez la clasificación, los extremos y la forma de las curvas de nivel.

Proposición 12.5 (curvas de nivel). El conjunto \{x : x^\top Ax = c\} con c>0 es, en la base propia:

  1. una elipse con semiejes \sqrt{c/\lambda_i} sobre los eigenvectores, si todos los \lambda_i>0;
  2. una hipérbola, si hay eigenvalores de los dos signos;
  3. un par de rectas paralelas o el vacío, si algún \lambda_i=0.

Demostración. Por (\ast), la ecuación x^\top Ax=c es \sum_i\lambda_iy_i^2=c en coordenadas y=Q^\top x. Con todos los \lambda_i>0 eso es \sum_i y_i^2/(c/\lambda_i)=1, la ecuación canónica de una elipse con semiejes \sqrt{c/\lambda_i}. Con signos mixtos en dimensión dos queda \lambda_1y_1^2-|\lambda_2|y_2^2=c, la ecuación canónica de una hipérbola. Y si \lambda_2=0 queda \lambda_1y_1^2=c, que son dos rectas y_1=\pm\sqrt{c/\lambda_1}, o el vacío si c/\lambda_1<0.

El mínimo medido sobre el círculo unitario coincide con el menor eigenvalor en los tres casos, hasta el sexto decimal: la Proposición 12.4, apartado (2), medida por fuerza bruta.

3. Dos fuentes inagotables de matrices definidas positivas

Proposición 12.6 (A^\top A). Para toda matriz X de m\times n, la matriz X^\top X es simétrica y semidefinida positiva. Es definida positiva si y solo si X tiene rango columna completo.

Demostración. Es simétrica porque (X^\top X)^\top = X^\top X. Para el signo, v^\top X^\top X v = (Xv)^\top(Xv) = \|Xv\|^2 \ge 0, con igualdad si y solo si Xv=0. Si las columnas de X son independientes, eso obliga a v=0 y la forma es estrictamente positiva fuera del origen; si no lo son, existe v\ne0 en el núcleo y la forma se anula en él.

Esa es la proposición que sostenía, sin nombre, la unicidad de mínimos cuadrados en la lección 6 y la existencia de la descomposición en valores singulares en la 11. La segunda fuente es un certificado constructivo.

Proposición 12.7 (Cholesky). Una matriz simétrica A es definida positiva si y solo si existe L triangular inferior con diagonal estrictamente positiva tal que A=LL^\top. Esa L es única.

Demostración. Si existe L, entonces para x\ne0 x^\top Ax = x^\top LL^\top x = \|L^\top x\|^2 > 0, porque L es invertible, triangular con diagonal no nula, y por tanto L^\top x\ne0. Esa dirección es inmediata.

Si A es definida positiva, la construcción por filas produce L y a la vez lo demuestra. Escribiendo A=LL^\top entrada a entrada, la fila i da a_{ij} = \sum_{k\le j} \ell_{ik}\ell_{jk} \quad (j\le i), de donde, despejando en el orden j=1,\dots,i, \ell_{ij} = \frac{1}{\ell_{jj}}\Big(a_{ij}-\sum_{k<j}\ell_{ik}\ell_{jk}\Big), \qquad \ell_{ii} = \sqrt{a_{ii}-\sum_{k<i}\ell_{ik}^2}. Cada valor queda determinado por los anteriores, lo que prueba la unicidad; y la raíz cuadrada de la diagonal existe porque el radicando es positivo exactamente cuando A es definida positiva (es el complemento de Schur del bloque ya procesado, que hereda la definición positiva).. Ese último paso se usa aquí sin demostrar, y queda declarado en Fuentes; lo que sí muestra la celda es que el algoritmo se detiene y señala dónde cuando la matriz no lo es.

La matriz \begin{pmatrix}2&3\\3&2\end{pmatrix} tiene eigenvalores 5 y -1, y el algoritmo se detiene en la segunda posición con un pivote de -2{,}5: no hay raíz cuadrada que sacar. Por eso, en la práctica, intentar la factorización es la forma barata de comprobar la definición positiva, y es lo que hacen por dentro las librerías que necesitan saberlo.

Ejercicios

Ejercicio 1, Sortear de una normal multivariante con Cholesky

Si z tiene componentes independientes \mathcal{N}(0,1) y \Sigma=LL^\top, entonces x=Lz tiene matriz de covarianza \Sigma. Comprobarlo y contrastar con la elipse de Estadística 12.

Ejercicio 2, El cociente de Rayleigh entre dos matrices

El mínimo de x^\top Ax sujeto a \|x\|=1 es el menor eigenvalor. Comprobar además la versión generalizada: el mínimo de x^\top Ax sujeto a x^\top Bx=1, con B definida positiva, es el menor eigenvalor de B^{-1}A, que aparece en análisis discriminante y en PCA con pesos.

Reto

En proyectos/notebooks/F1-retos.ipynb, sección Mat 12:

  1. Escribir es_definida_positiva(A) de tres maneras (por eigenvalores, por Cholesky y por los menores principales (criterio de Sylvester)) y comparar cuál es más rápida y cuál más robusta en matrices casi singulares. Anotar el resultado en 50-Errores/.
  2. Dibujar las curvas de nivel de x^\top Ax para una familia de matrices que pase de definida positiva a indefinida cruzando por semidefinida, y observar cómo la elipse se abre en hipérbola justo cuando un eigenvalor cruza el cero.
  3. Comprobar que la matriz de covarianza muestral de cualquier conjunto de datos es semidefinida positiva siempre, y definida positiva si y solo si ningún subconjunto de variables es combinación lineal exacta de otras. Construir un ejemplo de cada caso.

Del libro

Mathematics for Machine Learning introduce las matrices simétricas definidas positivas en §3.2 Inner Products, como las que definen productos internos generales, y la factorización en §4.3 Cholesky Decomposition. El libro tiene copyright y no es descargable desde el entorno en que se escribió esta página, así que se cita número y título y no se le atribuye ninguna frase.

Preguntas para leer §3.2 y §4.3 con lápiz:

  1. MML define un producto interno general como una forma bilineal simétrica definida positiva. Con la Proposición 12.4, ¿qué condición sobre los eigenvalores de A hace que \langle x,y\rangle_A=x^\top Ay sea un producto interno de verdad?
  2. §4.3 presenta Cholesky como una factorización y menciona su coste. ¿Por qué es aproximadamente la mitad que el de una factorización LU general?
  3. El libro usa Cholesky para calcular determinantes de matrices definidas positivas. ¿Cuánto vale \det A en términos de la diagonal de L, y por qué eso es más estable que multiplicar pivotes de una eliminación cualquiera?

Para el Cerebro

Nota nueva en 10-Conceptos/formas-cuadraticas.md, enlazada a [[diagonalizacion]], [[matriz-de-covarianza]] y [[hessiana]]. La identidad (\ast) de la Proposición 12.4 conviene rehacerla a mano: de esas dos líneas salen la clasificación, los extremos y la forma de las curvas de nivel.

¿Qué es una forma cuadrática?::La función q(x) = xᵀAx, un polinomio homogéneo de grado dos
¿Por qué basta con matrices simétricas?::Porque xᵀAx = xᵀSx con S la parte simétrica: la antisimétrica se cancela
¿Cuándo es A definida positiva?::Cuando xᵀAx > 0 para todo x ≠ 0, y eso equivale a que todos sus eigenvalores sean positivos
¿Cómo se ve la forma en la base propia?::Como una suma de cuadrados con pesos: Σ λᵢ yᵢ²
¿Cuánto vale el mínimo de xᵀAx sobre ‖x‖ = 1?::El menor eigenvalor; el máximo es el mayor
¿Qué forma tienen las curvas de nivel?::Elipses si todos los λ son positivos, hipérbolas con signos mixtos, rectas si algún λ es cero
¿Cuánto miden los semiejes de la elipse?::√(c/λᵢ) en la dirección de cada eigenvector
¿Es XᵀX definida positiva?::Semidefinida siempre, y definida si y solo si X tiene rango columna completo
¿Qué es la factorización de Cholesky?::A = LLᵀ con L triangular inferior de diagonal positiva; existe si y solo si A es definida positiva
¿Para qué sirve en la práctica?::Para certificar la definición positiva, para resolver sistemas y para sortear de una normal multivariante con x = Lz

Fuentes

Lo que esta página demuestra sola. Las Proposiciones 12.2, 12.4, 12.5 y 12.6 y la dirección fácil de la 12.7 se demuestran aquí, a partir de la diagonalización ortogonal de la lección 10. Se comprueban además numéricamente: que la parte antisimétrica no altera la forma en mil vectores; que el mínimo sobre el círculo unitario es el menor eigenvalor en los tres tipos de matriz; la construcción de Cholesky contra np.linalg.cholesky, con el algoritmo deteniéndose y señalando el pivote negativo en una matriz indefinida; que X^\top X pasa de definida a solo semidefinida al perder rango; que x=Lz reproduce la covarianza pedida en 200 000 puntos; y la versión generalizada del cociente de Rayleigh. El visual se contrastó antes de publicarse: 61 × 61 combinaciones de eigenvalores × 35 giros.

Lo que se usa de otras lecciones sin repetir. La diagonalización ortogonal y el teorema espectral son la lección 10. Que \|Xv\|^2=v^\top X^\top Xv ya se usó en las lecciones 6 y 11; aquí recibe su nombre.

Lo que se enuncia sin demostrar. En la Proposición 12.7, que el radicando de cada raíz sea positivo cuando A es definida positiva: eso requiere ver que el complemento de Schur hereda la definición positiva, y queda fuera. La dirección contraria (si existe L, la matriz es definida positiva) sí está demostrada, y el algoritmo se comprueba en la celda.

Lo que viene de los libros.

  • Mathematics for Machine Learning (Deisenroth, Faisal & Ong, Cambridge University Press, 2020), §3.2 Inner Products y §4.3 Cholesky Decomposition — citadas por número y título, sin transcribir texto.

Lo que es mío, no del libro. La identidad (\ast) como eje de toda la lección (clasificación, extremos y curvas de nivel salen de ella), y la presentación de Cholesky como certificado constructivo de definición positiva más que como método de resolución.

Índices verificados el 12-09-2026 contra el índice publicado del PDF oficial.

→ Siguiente: Derivada, regla de la cadena y gradiente