Diagnóstico de la regresión: qué falla y cómo se ve

Machine Learning · Lección 2

L3 From scratch Fase F2 Libro ISLP §3.3 Prereqs Sesgo y varianza · Inferencia sobre coeficientes

Objetivo

Al terminar esta lección se puede:

  1. Codificar un predictor cualitativo y demostrar por qué incluir una variable indicadora por nivel más el intercepto deja la matriz sin rango completo.
  2. Demostrar que la casi colinealidad no sesga el estimador sino que multiplica su varianza por el factor de inflación, y calcular ese factor.
  3. Demostrar que la heterocedasticidad deja el estimador insesgado y rompe el error estándar, y medir cuánta cobertura se pierde.
  4. Definir la palanca de una observación, demostrar que las palancas suman el número de parámetros, y reconocer un punto que arrastra el ajuste él solo.

De dónde viene

  • Estadística 13 y 14: de dónde salen los coeficientes y cómo se hace inferencia sobre ellos. Esta lección no repite esa derivación: la da por hecha y pregunta qué pasa cuando sus supuestos fallan.
  • ML 1: la varianza de un estimador como una de las tres piezas del error. La colinealidad es una forma concreta de inflarla.
  • Álgebra 6: la matriz sombrero H=X(X^\top X)^{-1}X^\top como proyección, y el número de condición. La palanca es su diagonal, y la colinealidad es su mal condicionamiento.
  • Álgebra 3: el rango y la independencia de columnas, que es lo que la Proposición 2.2 viola.

Para qué sirve después

  • ML 5: la regularización nace de la Proposición 2.4. Si la colinealidad multiplica la varianza, admitir algo de sesgo para reducirla es un intercambio favorable.
  • ML 3: los predictores cualitativos vuelven en clasificación, con la misma codificación y la misma trampa.
  • Estadística 16: un modelo mal diagnosticado produce probabilidades mal calibradas, y ahí ya no se ve de dónde viene el problema.
  • Inferencia causal: la colinealidad entre tratamiento y confusor es la razón de que un efecto salga con intervalo enorme.

Notación

Símbolo Se lee Significado
X equis La matriz de diseño, con n filas y p columnas
H hache La matriz sombrero X(X^\top X)^{-1}X^\top, que proyecta sobre el espacio columna
h_{ii} hache sub i i La palanca de la observación i: el elemento i de la diagonal de H
R_j^2 erre cuadrado sub jota El R^2 de regresar el predictor j contra todos los demás
VIF vif El factor de inflación de la varianza, 1/(1-R_j^2)
\rho rho La correlación entre dos predictores
colinealidad Aquí, casi colinealidad: un predictor es casi combinación lineal de los demás, el rango sigue siendo completo y los coeficientes siguen identificados. La colinealidad perfecta de Álgebra 3, que sí baja el rango, es el caso de la Proposición 2.2

1. Predictores cualitativos, y una matriz que se rompe

Definición 2.1 (variable indicadora). Dado un predictor cualitativo con k niveles, su indicadora del nivel j es la columna que vale 1 en las observaciones de ese nivel y 0 en las demás. Codificar el predictor consiste en sustituirlo por un conjunto de indicadoras.

Proposición 2.2 (por qué sobra una). Sea un predictor cualitativo con k niveles y sea X la matriz que contiene la columna de unos del intercepto y las k indicadoras. Entonces X no tiene rango completo: sus columnas son linealmente dependientes, el sistema de ecuaciones normales es singular y los coeficientes no quedan determinados.

Usar k-1 indicadoras y dejar un nivel como referencia restaura el rango completo sin perder información.

Demostración. Cada observación pertenece a exactamente un nivel, de modo que en cada fila una sola indicadora vale 1 y el resto 0. La suma de las k columnas indicadoras es entonces el vector de unos, que es precisamente la columna del intercepto: \sum_{j=1}^{k} d_j = \mathbf{1}. Esa igualdad es una combinación lineal no trivial de las columnas que da el vector nulo al restar el intercepto, luego las columnas son dependientes y el rango es a lo sumo k en lugar de k+1. Por la lección 3 de Álgebra, X^\top X es entonces singular y el sistema normal no tiene solución única.

Al quitar una indicadora, la identidad anterior deja de poder formarse: ninguna combinación de las k-1 restantes da el vector de unos, porque las observaciones del nivel omitido tendrían cero en todas ellas. El rango vuelve a ser completo. No se pierde información: el nivel omitido queda representado por el intercepto, y los demás coeficientes se leen como diferencias respecto de él.

Lo que conviene retener es que ninguna de las dos rutinas sirve de diagnóstico. Que solve lance LinAlgError depende de la implementación de LAPACK: con unas el determinante sale exactamente cero y avisa, con otras sale del orden de 10^{-11} y devuelve un resultado sin decir nada. lstsq no protesta nunca, y entrega la solución de norma mínima entre las infinitas que hay.

Lo que responde siempre es el rango, y el número de condición lo confirma. El ajuste es correcto, porque las predicciones coinciden con las del modelo bien planteado, pero los coeficientes no significan lo que parecen: otra solución igual de válida daría otros valores. Un informe que los interprete uno a uno está informando de una elección arbitraria del algoritmo.

2. Colinealidad

Definición 2.3 (factor de inflación de la varianza). Para el predictor j, sea R_j^2 el coeficiente de determinación de la regresión de ese predictor contra todos los demás. Su factor de inflación de la varianza es \mathrm{VIF}_j = \frac{1}{1-R_j^2}. Vale 1 cuando el predictor es ortogonal al resto y crece sin límite cuando se acerca a ser una combinación lineal de ellos.

Proposición 2.4 (la colinealidad multiplica la varianza). En el modelo lineal con ruido de varianza \sigma^2, \operatorname{Var}(\hat\beta_j) = \frac{\sigma^2}{(n-1)s_j^2}\cdot \mathrm{VIF}_j, con s_j^2 la varianza muestral del predictor j. El estimador sigue siendo insesgado: la colinealidad no lo desplaza, solo lo hace más variable.

Con dos predictores de correlación \rho, el factor vale 1/(1-\rho^2).

Demostración (del caso de dos predictores, que es el que la celda mide). La varianza de \hat\beta es \sigma^2(X^\top X)^{-1}, y su elemento (j,j) es lo que se busca. Para dos predictores centrados con varianzas muestrales s_1^2, s_2^2 y correlación \rho, la submatriz de X^\top X correspondiente es (n-1) veces la matriz de covarianzas, cuyo determinante es s_1^2s_2^2(1-\rho^2). Invirtiendo una matriz 2\times2, el elemento (1,1) de la inversa es el (2,2) del original dividido por el determinante: \big[(X^\top X)^{-1}\big]_{11} = \frac{(n-1)s_2^2}{(n-1)^2 s_1^2 s_2^2 (1-\rho^2)} = \frac{1}{(n-1)s_1^2}\cdot\frac{1}{1-\rho^2}. Multiplicando por \sigma^2 se obtiene el enunciado, con \mathrm{VIF}_1=1/(1-\rho^2), que es la Definición 2.3 porque en el caso de dos predictores R_1^2=\rho^2.

La insesgadez no depende de nada de esto: E[\hat\beta]=\beta siempre que X tenga rango completo, por muy mal condicionada que esté.

La varianza medida pasa de 0{,}0051 a 0{,}24 al subir la correlación de 0 a 0{,}99: casi cincuenta veces más. Y la última columna, que es esa varianza dividida por el VIF teórico, da la misma cifra en las tres filas. La Proposición 2.4 explica por qué: la colinealidad no introduce ningún efecto nuevo, multiplica por un número que se puede calcular de antemano.

La consecuencia práctica no es «quitar variables correlacionadas» sin más. Es que un coeficiente con VIF alto viene con un intervalo ancho, y un intervalo ancho no permite afirmar gran cosa sobre ese coeficiente aunque el modelo entero prediga bien. Predecir y atribuir son dos usos distintos, y la colinealidad solo estropea el segundo.

La elipse no se desplaza al aumentar \rho: se alarga en la diagonal. Esa dirección es la de «cuánto de este efecto es de x_1 y cuánto de x_2», que es justo lo que unos datos colineales no pueden responder. La dirección perpendicular, la suma de los dos efectos, se sigue estimando bien, y por eso el modelo predice sin problema.

3. Heterocedasticidad

Proposición 2.5 (varianza no constante: el estimador aguanta, el intervalo no). Si la varianza del ruido depende de x, el estimador de mínimos cuadrados sigue siendo insesgado, pero la fórmula habitual del error estándar deja de ser válida y los intervalos de confianza pierden cobertura.

Demostración. Para la insesgadez, \hat\beta = (X^\top X)^{-1}X^\top y y E[y]=X\beta, de donde E[\hat\beta]=\beta. En ese cálculo solo se usa que el ruido tiene media cero; nada obliga a que su varianza sea constante, así que la insesgadez sobrevive intacta.

Para la segunda parte, la varianza correcta es (X^\top X)^{-1}X^\top \Omega X (X^\top X)^{-1}, con \Omega la matriz diagonal de varianzas. La fórmula habitual supone \Omega=\sigma^2 I y la reduce a \sigma^2(X^\top X)^{-1}, que en general no coincide con la anterior. El intervalo se construye con la fórmula equivocada, y su cobertura deja de ser la nominal.

Las dos medias caen sobre el valor verdadero, 2. Lo que cambia es la última columna: la cobertura baja del 94 % al 86 %. Un intervalo anunciado como del 95 % que acierta el 86 % de las veces no es un intervalo del 95 %, y quien lo lea sacará conclusiones con más confianza de la que le corresponde.

Esto es exactamente lo contrario del sesgo, y por eso es tan fácil pasarlo por alto: el modelo no se equivoca al estimar, se equivoca al decir cuánto se equivoca.

4. Palanca

Definición 2.6 (palanca). La palanca de la observación i es h_{ii}, el elemento i de la diagonal de la matriz sombrero H=X(X^\top X)^{-1}X^\top de Álgebra 6. Cumple 0\le h_{ii}\le 1 y mide cuánto influye y_i sobre su propio valor ajustado: \partial\hat{y}_i/\partial y_i = h_{ii}.

Proposición 2.7 (las palancas suman los parámetros). \sum_{i=1}^n h_{ii} = p, de modo que la palanca media vale p/n. Una observación con h_{ii} cercano a 1 determina su propio ajuste casi por completo, y el residuo en ella es casi cero por construcción, aunque el punto sea absurdo.

Demostración. H es la matriz de una proyección ortogonal sobre el espacio columna de X, que tiene dimensión p cuando X tiene rango completo. La traza de la matriz de una proyección es igual a la dimensión del subespacio sobre el que proyecta, porque sus autovalores son 1 con multiplicidad p y 0 con multiplicidad n-p y la traza es su suma. La traza es también la suma de la diagonal, de donde \sum h_{ii}=p y la media es p/n.

Para la segunda parte, el residuo cumple y_i-\hat{y}_i = (1-h_{ii})y_i - \sum_{k\ne i}h_{ik}y_k; cuando h_{ii}\to1 el primer factor tiende a cero y, por ser H idempotente y simétrica, los h_{ik} restantes también, de modo que el residuo tiende a cero con independencia del valor de y_i. Un punto de palanca alta no puede tener residuo grande, y por eso no aparece al inspeccionar residuos.

La traza da 2{,}000000, 5{,}000000 y 10{,}000000: exactamente el número de parámetros, sin error numérico apreciable. Y la palanca media es p/n, lo que da el criterio habitual para señalar un punto como influyente, que su h_{ii} supere varias veces esa media.

El corolario de la demostración es el que más cuesta interiorizar: un punto de palanca alta tiene residuo pequeño por construcción. Buscar observaciones influyentes mirando los residuos grandes encuentra justamente las que no lo son.

Arrastrar el punto hacia la derecha no cambia su altura, y sin embargo la recta gira. Cuanto más lejos cae del resto en el eje horizontal, mayor es su palanca y más manda sobre el ajuste, y menor es su residuo, que es lo que lo hace invisible en una inspección de residuos.

Ejercicios

Ejercicio 1, Cuántas indicadoras

Codificar un predictor cualitativo de 4 niveles sin romper el rango de la matriz.

Por la Proposición 2.2, con el intercepto hay que dejar fuera una indicadora. Con 4 niveles quedan 3, más la columna de unos.

Ejercicio 2, Qué correlación es demasiada

Calcular a partir de qué correlación el factor de inflación supera 10, que es el umbral de aviso más usado.

Por la Definición 2.3, con dos predictores el factor vale 1/(1-\rho^2). Igualar a 10 y despejar \rho, quedándose con la raíz positiva.

Reto

En proyectos/notebooks/F2-retos.ipynb, sección ML 2:

  1. Implementar el cálculo del VIF para un número cualquiera de predictores regresando cada uno contra los demás, y comprobar contra la Proposición 2.4 que \operatorname{Var}(\hat\beta_j) medida por simulación coincide con la fórmula. Probarlo con tres predictores donde el tercero sea casi la suma de los dos primeros.
  2. Construir un punto de palanca alta y comprobar las dos partes del corolario: que arrastra la pendiente y que su residuo es de los más pequeños. Escribir un criterio que lo detecte usando h_{ii} y comprobar que la inspección de residuos no lo encuentra.
  3. Medir la cobertura de la Proposición 2.5 con errores estándar robustos, la fórmula sándwich (X^\top X)^{-1}X^\top\hat\Omega X(X^\top X)^{-1} con \hat\Omega la diagonal de residuos al cuadrado, y comprobar cuánta cobertura se recupera. Anotar en 50-Errores/ qué supuesto se sigue necesitando.

Del libro

An Introduction to Statistical Learning with Applications in Python trata este material en §3.3 Other Considerations in the Regression Model, con los predictores cualitativos en §3.3.1 Qualitative Predictors y el catálogo de fallos en §3.3.3 Potential Problems.

Las secciones §3.1 y §3.2, regresión simple y múltiple, no se repiten aquí: están demostradas desde primeros principios en Estadística 13 y 14, con más detalle del que da el libro, y esta lección las usa como punto de partida.

Preguntas para leer §3.3 con lápiz:

  1. §3.3.3 enumera seis problemas potenciales. Con las Proposiciones 2.4, 2.5 y 2.7, ¿cuáles de los seis afectan al estimador y cuáles solo a la incertidumbre declarada? La respuesta cambia lo que hay que hacer con cada uno.
  2. La sección propone gráficos de residuos para detectar no linealidad y varianza no constante. Con el corolario de la Proposición 2.7, ¿por qué esa herramienta es ciega precisamente a los puntos de palanca alta?
  3. §3.3.2 introduce los términos de interacción y el principio de jerarquía. Con la Definición 2.1 y la Proposición 2.2, ¿qué le pasa al rango de la matriz si se incluye la interacción de dos indicadoras del mismo predictor cualitativo?

Para el Cerebro

Nota nueva en 10-Conceptos/diagnostico-regresion.md, enlazada a [[sesgo-varianza]] y a las notas de Estadística 13 y 14. Conviene rehacer a mano la demostración de la Proposición 2.7: la traza de una proyección es la dimensión del subespacio, y de ese hecho de una línea salen a la vez el valor medio de la palanca y el criterio para detectar puntos influyentes.

¿Cuántas indicadoras se usan con k niveles?::k−1, más el intercepto. Las k juntas suman la columna de unos y rompen el rango
¿Qué hace lstsq con una matriz deficiente?::Devuelve la solución de norma mínima sin protestar; el ajuste es correcto pero los coeficientes no son únicos
¿Qué es el VIF?::1/(1−R²_j), con R²_j el de regresar el predictor j contra los demás. Con dos predictores, 1/(1−ρ²)
¿Qué le hace la colinealidad al estimador?::Nada a su centro: sigue insesgado. Multiplica su varianza por el VIF
¿Qué ρ hace falta para VIF = 10?::ρ ≈ 0,95. El umbral habitual es más permisivo de lo que parece
¿Por qué la elipse se alarga en la diagonal?::Los datos no distinguen cuál de los dos predictores lleva el efecto, pero sí estiman bien su suma
¿La heterocedasticidad sesga el estimador?::No. Solo invalida el error estándar, y con él la cobertura: del 94 % al 86 %
¿Por qué sobrevive la insesgadez?::Su demostración solo usa que el ruido tiene media cero, nunca que la varianza sea constante
¿Qué es la palanca h_ii?::La diagonal de la matriz sombrero: cuánto influye y_i sobre su propio ajuste
¿Cuánto suman las palancas?::p, el número de parámetros, porque la traza de una proyección es la dimensión del subespacio
¿Cuánto vale la palanca media?::p/n, y el criterio habitual señala los puntos que la superan varias veces
¿Por qué los residuos no detectan la palanca alta?::Porque un punto de palanca alta tiene residuo pequeño por construcción: el ajuste pasa casi por él

Fuentes

Lo que esta página demuestra sola. Las Proposiciones 2.2, 2.4, 2.5 y 2.7 se demuestran a partir del rango de la matriz de diseño, de la inversa de una matriz 2\times2, de la definición del estimador de mínimos cuadrados y de la traza de una proyección. Las cuatro se comprueban ejecutándolas: que con tres indicadoras y el intercepto la matriz tiene cuatro columnas y rango tres, que solve lanza LinAlgError y lstsq devuelve la solución de norma mínima sin protestar, y que el ajuste coincide por los dos caminos; que la varianza medida del coeficiente pasa de 0{,}0051 a 0{,}24 al subir \rho de 0 a 0{,}99 y que al dividirla por el VIF teórico se recupera la misma cifra en las tres filas; que la media del estimador cae sobre 2 con ruido constante y con ruido creciente mientras la cobertura del intervalo baja del 94 % al 86 %; y que la traza de la matriz sombrero vale exactamente 2, 5 y 10 para esos números de parámetros. Los dos visuales se contrastaron contra estas mismas cantidades en todo el rango de sus controles.

Lo que se usa de otras lecciones sin repetir. La derivación de los coeficientes es Estadística 13 y la inferencia sobre ellos Estadística 14; esta lección las da por hechas y no las reproduce. La matriz sombrero como proyección y el número de condición son de Álgebra 6. El rango y la independencia de columnas, de Álgebra 3. La varianza como pieza del error esperado, de ML 1.

Lo que se enuncia sin demostrar. La fórmula general \operatorname{Var}(\hat\beta_j)=\sigma^2/((n-1)s_j^2)\cdot\mathrm{VIF}_j se demuestra aquí solo en el caso de dos predictores, que es el que la celda mide; el caso general requiere la inversa por bloques. En la Proposición 2.5 se escribe la varianza correcta bajo heterocedasticidad sin derivar el estimador sándwich, que queda para el reto. Las coberturas medidas llevan el error de Monte Carlo de 2500 réplicas y no se acompañan de un intervalo.

Lo que viene de los libros.

Lo que es mío, no del libro. La decisión de que esta lección no cubra §3.1 ni §3.2, porque su material ya está demostrado con más profundidad en Estadística 13 y 14, y dedicarse en su lugar a lo que el libro añade y el resto del repositorio no tiene. La Proposición 2.4 con el VIF despejado y medido, dividir la varianza observada por el factor teórico y obtener la misma constante, en lugar de presentarlo como un indicador que hay que vigilar. Y el corolario de la Proposición 2.7 sobre el residuo pequeño, que convierte el consejo de «mirar los residuos» en una advertencia sobre su punto ciego.

Índice de ISLP verificado el 13-09-2026 contra los marcadores del PDF oficial, con sus tres niveles.