Regresión: de dónde salen los coeficientes

Estadística · Lección 13

L3 Derivación Fase F1 Libro TS 3e §10 Prereqs Mínimos cuadrados · Covarianza y correlación

Objetivo

Al terminar esta lección se puede:

  1. Derivar los coeficientes de la recta de regresión y reconocer que la pendiente es la covarianza normalizada.
  2. Demostrar que hay dos rectas de regresión, que no coinciden, y que el producto de sus pendientes es r^2.
  3. Demostrar la descomposición \text{SCT} = \text{SCR} + \text{SCE} y que R^2 = r^2 en regresión simple.
  4. Explicar por qué un R^2 alto no garantiza que el modelo sea correcto, y qué hay que mirar en su lugar.

De dónde viene

  • Matemática 5 y 6: los mínimos cuadrados ya aparecieron como proyección ortogonal. Allí no había probabilidad; aquí se le añade un modelo. La Proposición 13.6 es la misma ortogonalidad, escrita en sumas.
  • Estadística 5: la covarianza y la correlación. La Proposición 13.2 dice que la pendiente es \text{Cov}(x,y)/\text{Var}(x), y la Proposición 13.4 rescata la Proposición 5.9 —|r| como media geométrica de dos pendientes— y la convierte en un enunciado sobre dos rectas.
  • Estadística 8: la Proposición 8.8 demostró que minimizar cuadrados es máxima verosimilitud bajo errores normales. Eso es lo que convierte el cálculo de esta lección en un modelo estadístico.

Para qué sirve después

  • Lección 14: los errores estándar de \hat{\beta}_0 y \hat{\beta}_1, sus intervalos y sus pruebas. Aquí se obtienen los números; allí, su incertidumbre.
  • Lección 15: qué pasa cuando faltan datos, y por qué el mecanismo de la falta cambia el resultado.
  • ISLP cap. 3: la regresión múltiple es esto con más columnas, y la geometría no cambia: sigue siendo una proyección.
  • Aprendizaje automático: es el modelo más simple que existe, y el patrón de referencia contra el que se mide cualquier otro.

Notación

Símbolo Se lee Significado
\beta_0, \beta_1 beta cero, beta uno Los coeficientes verdaderos del modelo, desconocidos
\hat{\beta}_0, \hat{\beta}_1 beta cero sombrero Los estimados a partir de los datos
\hat{y}_i ye sombrero sub i El valor predicho, \hat{\beta}_0 + \hat{\beta}_1 x_i
e_i e sub i El residuo, y_i - \hat{y}_i. No confundir con \varepsilon_i
\varepsilon_i épsilon sub i El error verdadero del modelo, que nunca se observa
\text{SCT} ese ce te Suma de cuadrados total, \sum_i (y_i-\bar{y})^2
\text{SCR} ese ce erre Suma de cuadrados de la regresión, \sum_i (\hat{y}_i-\bar{y})^2
\text{SCE} ese ce e Suma de cuadrados del error, \sum_i e_i^2
R^2 erre cuadrado \text{SCR}/\text{SCT}, la fracción de varianza explicada

La distinción entre e_i y \varepsilon_i es la que más se pierde de vista y la que más importa. \varepsilon_i es una variable aleatoria del modelo, que no se ve nunca; e_i es un número calculado tras ajustar la recta. Se parecen, pero no son lo mismo: los \varepsilon_i son independientes entre sí, y los e_i no —suman cero por construcción, así que conocidos n-2 de ellos los otros dos quedan atados—.

1. El modelo, y lo que no es

Definición 13.1 (modelo de regresión lineal simple). y_i = \beta_0 + \beta_1 x_i + \varepsilon_i, \qquad i = 1,\dots,n, con los \varepsilon_i independientes, de media cero y varianza \sigma^2 constante, y los x_i tratados como fijos.

Cuatro supuestos van escondidos ahí y conviene tenerlos a la vista, porque la sección 4 los pone a prueba uno a uno: que la relación es lineal, que los errores son independientes, que su varianza es constante —no crece con x—, y que su media es cero para todo x.

Nada de eso se comprueba ajustando la recta. Ajustar es un cálculo que siempre da un número; los supuestos dicen si ese número significa algo.

A line that minimizes the sum of squared residuals.

Downey, Think Stats 3e, §10.7 Glossary, definición de linear least squares fit

2. Los coeficientes

Proposición 13.2. Los valores de b_0 y b_1 que minimizan S(b_0,b_1) = \sum_{i=1}^{n}\big(y_i - b_0 - b_1 x_i\big)^2 son \hat{\beta}_1 = \frac{\sum_i (x_i-\bar{x})(y_i-\bar{y})}{\sum_i (x_i-\bar{x})^2} = \frac{\text{Cov}(x,y)}{\text{Var}(x)} = r\,\frac{s_y}{s_x}, \qquad \hat{\beta}_0 = \bar{y} - \hat{\beta}_1\bar{x}.

Demostración. S es una suma de cuadrados, luego es no negativa, y es un polinomio de segundo grado en (b_0,b_1) con coeficientes principales positivos: tiene un único mínimo, y se alcanza donde las dos derivadas parciales se anulan.

Primera ecuación. Derivando respecto a b_0 y usando la regla de la cadena: \frac{\partial S}{\partial b_0} = \sum_i 2\big(y_i - b_0 - b_1x_i\big)(-1) = 0 \;\Longleftrightarrow\; \sum_i y_i = n b_0 + b_1\sum_i x_i. Dividiendo entre n queda \bar{y} = b_0 + b_1\bar{x}, es decir, la recta pasa por el punto (\bar{x},\bar{y}), y despejando, b_0 = \bar{y}-b_1\bar{x}.

Segunda ecuación. Derivando respecto a b_1: \frac{\partial S}{\partial b_1} = \sum_i 2\big(y_i - b_0 - b_1x_i\big)(-x_i) = 0 \;\Longleftrightarrow\; \sum_i x_i y_i = b_0\sum_i x_i + b_1\sum_i x_i^2. Sustituyendo b_0 = \bar{y}-b_1\bar{x} y agrupando los términos en b_1: \sum_i x_iy_i - n\bar{x}\bar{y} = b_1\Big(\sum_i x_i^2 - n\bar{x}^2\Big). Los dos lados son formas conocidas: \sum_i x_iy_i - n\bar{x}\bar{y} = \sum_i (x_i-\bar{x})(y_i-\bar{y}) y \sum_i x_i^2 - n\bar{x}^2 = \sum_i (x_i-\bar{x})^2, las dos por la Proposición 5.5. Despejando b_1 se obtiene la fórmula del enunciado; la tercera forma sale de dividir numerador y denominador entre n y aplicar la Definición 5.6 de correlación.

Dos lecturas que la fórmula regala.

La primera: la pendiente es la covarianza normalizada por la varianza de x. Todo lo que la lección 5 dijo sobre la covarianza vale aquí sin traducción: si \text{Cov}(x,y) = 0 la pendiente es cero, y si se cambia la escala de x la pendiente se reescala en consecuencia.

La segunda: en la forma \hat{\beta}_1 = r\,s_y/s_x, si las dos variables se estandarizan —media cero y desviación uno— entonces s_y = s_x = 1 y la pendiente es exactamente r. La correlación es la pendiente en unidades estandarizadas.

Los cuadrados naranjas del visual son literalmente cuadrados: de lado |e_i| y área e_i^2. La suma de sus áreas es lo que se minimiza, y de ahí el nombre del método. Mover cualquiera de los dos controles la agranda; el botón devuelve al mínimo.

El panel derecho es S en función de b_1: una parábola con un único mínimo. Por eso la demostración puede limitarse a anular la derivada sin comprobar nada más —en una función con varios mínimos locales ese paso no bastaría—.

3. Hay dos rectas, no una

Proposición 13.3. La recta que minimiza los errores en y y la que los minimiza en x no son la misma, salvo si |r| = 1.

Proposición 13.4. Si b_{y|x} es la pendiente de y sobre x y b_{x|y} la de x sobre y, entonces b_{y|x} \cdot b_{x|y} = r^2.

Demostración. Por la Proposición 13.2 aplicada en cada sentido —basta intercambiar los papeles de las dos variables—: b_{y|x} = \frac{\text{Cov}(x,y)}{\text{Var}(x)}, \qquad b_{x|y} = \frac{\text{Cov}(x,y)}{\text{Var}(y)}. Multiplicando, b_{y|x}\,b_{x|y} = \frac{\text{Cov}(x,y)^2}{\text{Var}(x)\text{Var}(y)} = r^2, por la Definición 5.6. Como r^2 \le 1 por la Proposición 5.4, el producto nunca pasa de uno, y vale uno exactamente cuando |r| = 1. Si las dos rectas fueran la misma, la segunda pendiente sería la inversa de la primera y el producto valdría uno; luego coinciden solo en ese caso.

Ese es el resultado de la Proposición 5.9 —|r| como media geométrica de las dos pendientes— ahora con nombre: las dos pendientes son las de dos rectas de regresión distintas.

Que haya dos rectas es lo que hace que el método no sea simétrico. «La recta que mejor describe la relación» no está bien definida; hay que decir qué se predice a partir de qué. Predecir el peso a partir de la altura y predecir la altura a partir del peso son dos problemas y dan dos rectas.

La franja del visual enseña de dónde sale la asimetría. Tomando solo los puntos con x \approx 1{,}8, la media de sus y cae más cerca del centro que 1,8. Eso es todo lo que hay detrás de la regresión a la media: si |r| < 1, la pendiente r\,s_y/s_x es, en unidades estandarizadas, menor que uno, así que un valor extremo de x predice un valor menos extremo de y.

Note

La regresión a la media se confunde a menudo con un fenómeno causal —«castigar funciona porque después mejoran»— cuando es una consecuencia aritmética de que |r| < 1. El grupo seleccionado por un valor extremo mejora en la siguiente medición aunque no se haga nada, y el mismo efecto aparece midiendo hacia atrás en el tiempo, donde ninguna causa puede actuar. La lección 17 vuelve sobre esto.

4. La descomposición, R^2, y lo que R^2 no dice

Definición 13.5. \text{SCT} = \sum_i (y_i-\bar{y})^2, \;\text{SCR} = \sum_i (\hat{y}_i-\bar{y})^2, \;\text{SCE} = \sum_i (y_i-\hat{y}_i)^2, y R^2 = \frac{\text{SCR}}{\text{SCT}} = 1 - \frac{\text{SCE}}{\text{SCT}}.

Proposición 13.6. \text{SCT} = \text{SCR} + \text{SCE}, y en regresión lineal simple R^2 = r^2.

Demostración. Se suma y se resta \hat{y}_i dentro del cuadrado: \text{SCT} = \sum_i \big((y_i-\hat{y}_i) + (\hat{y}_i-\bar{y})\big)^2 = \underbrace{\sum_i (y_i-\hat{y}_i)^2}_{\text{SCE}} + \underbrace{\sum_i (\hat{y}_i-\bar{y})^2}_{\text{SCR}} + 2\sum_i e_i(\hat{y}_i-\bar{y}). El término cruzado se anula. Escribiendo \hat{y}_i - \bar{y} = \hat{\beta}_1(x_i-\bar{x}) —que sale de restar la recta evaluada en \bar{x}, y usa que pasa por (\bar{x},\bar{y})—: \sum_i e_i(\hat{y}_i-\bar{y}) = \hat{\beta}_1\sum_i e_i(x_i-\bar{x}) = \hat{\beta}_1\Big(\sum_i e_ix_i - \bar{x}\sum_i e_i\Big) = 0, porque las dos ecuaciones normales de la demostración anterior dicen exactamente \sum_i e_i = 0 y \sum_i e_ix_i = 0. Los residuos son ortogonales a x y a la constante: es la proyección ortogonal de la Matemática 5, escrita en sumas.

Para la segunda parte, \text{SCR} = \hat{\beta}_1^2\sum_i(x_i-\bar{x})^2 por lo mismo, y sustituyendo \hat{\beta}_1 = r\,s_y/s_x: R^2 = \frac{\hat{\beta}_1^2\sum_i(x_i-\bar{x})^2}{\sum_i(y_i-\bar{y})^2} = \frac{r^2\,\dfrac{s_y^2}{s_x^2}\,(n-1)s_x^2}{(n-1)s_y^2} = r^2. \qquad

El término cruzado no se anula por casualidad: se anula porque los coeficientes se eligieron para que se anulara. Las ecuaciones normales son precisamente la condición de ortogonalidad, y por eso el teorema de Pitágoras se aplica. Es el mismo argumento que en la Proposición 7.5, con otros vectores.

Hasta aquí todo son identidades algebraicas que se cumplen siempre, haya modelo o no. Y ahí está el problema.

Las cuatro opciones dan un R^2 parecido y tres de ellas violan un supuesto distinto de la Definición 13.1:

  • curva: la media de los residuos no es cero para todo x; la línea negra hace un arco. La recta está sistemáticamente equivocada en los extremos y en el centro.
  • varianza creciente: la dispersión se abre hacia la derecha. La pendiente sigue siendo insesgada, pero su error estándar deja de valer, y con él todos los intervalos de la lección 14.
  • punto atípico: un solo dato en el borde del rango de x mueve la recta. Ahí es donde más palanca tiene, porque está lejos de \bar{x}.

El panel de los residuos delata las tres; el R^2 no delata ninguna. R^2 mide cuánta varianza explica la recta, no si la recta es la forma correcta. Es la misma advertencia de los cuartetos de Anscombe de la lección 5, aplicada a una cifra concreta.

Nótese que la media de los residuos sale cero en los tres casos, hasta el error de punto flotante. Eso no es una señal de buen ajuste, sino una identidad que sale de la primera ecuación normal y se cumple siempre, incluso ajustando una recta a datos que no tienen nada de lineal. Comprobar que los residuos suman cero no comprueba nada.

Ejercicios

Ejercicio 1 — La pendiente es la covarianza normalizada

Comprobar las tres formas de la Proposición 13.2 sobre 300 conjuntos aleatorios y devolver el mayor error absoluto entre ellas.

La primera es ((x-x.mean())*(y-y.mean())).sum() / ((x-x.mean())**2).sum(). La segunda usa np.cov(x,y)[0,1] / x.var(ddof=1). La tercera, np.corrcoef(x,y)[0,1] * y.std(ddof=1) / x.std(ddof=1).

b_suma = ((x-x.mean())*(y-y.mean())).sum() / ((x-x.mean())**2).sum()
b_cov  = np.cov(x, y)[0,1] / x.var(ddof=1)
b_r    = np.corrcoef(x, y)[0,1] * y.std(ddof=1) / x.std(ddof=1)
b_suma, b_cov, b_r = b_suma, b_cov, b_r

El error queda en el orden de 10^{-14}: son la misma fórmula escrita de tres maneras. El (n-1) de ddof=1 se cancela entre numerador y denominador, y por eso da igual usarlo o no mientras se use en los dos.

Ejercicio 2 — Regresión a la media

Generar 50 000 pares con correlación 0,5, quedarse con los que tienen x por encima de 2, y calcular la media de sus y. Devolver esa media.

X > 2 da una máscara booleana; Y[X > 2] selecciona los Y correspondientes.

media_y = Y[X > 2].mean()

La media de Y cae cerca de r veces la de X, es decir, alrededor de 1,2 frente a 2,4. No hay ninguna fuerza que empuje hacia el centro: es la pendiente r < 1, y nada más. Si se repite seleccionando por Y alta, los X de esos pares salen igualmente menos extremos, y ahí no puede haber causa ninguna.

Reto

En proyectos/notebooks/F1-retos.ipynb, sección Est 13:

  1. Escribir ajusta(x, y) que devuelva coeficientes, residuos, R^2 y las tres sumas de cuadrados, sin usar polyfit ni lstsq. Probarla contra np.polyfit sobre mil conjuntos aleatorios. Añadir diagnostico(x, y) que dibuje los cuatro gráficos de residuos habituales: contra x, contra \hat{y}, el histograma, y el gráfico cuantil-cuantil contra la normal.
  2. Medir el efecto palanca: tomar un conjunto lineal, mover un solo punto en vertical, y graficar cómo cambia la pendiente según dónde esté ese punto en el eje x. ¿Dónde hace más daño, en el centro o en el borde? Deducirlo también de la fórmula de \hat{\beta}_1 antes de mirar el gráfico.
  3. Reproducir la regresión a la media con datos de dos mediciones repetidas —simuladas con una correlación conocida— y comprobar que el efecto aparece igual midiendo hacia atrás en el tiempo. Escribir en dos frases por qué eso descarta la explicación causal.

Del libro

Think Stats se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.

A statistic, denoted R² and often pronounced ‘R squared’, that quantifies how well a model fits the data.

Downey, Think Stats 3e, §10.7 Glossary, definición de coefficient of determination

La frase «how well a model fits the data» es exacta y conviene leerla con cuidado: dice cuánto se ajusta, no si el modelo es el adecuado. La sección 4 de aquí desarrolla esa diferencia con cuatro conjuntos de R^2 parecido y supuestos rotos distintos.

Preguntas para leer §10 con lápiz:

  1. §10.3 se titula Minimizing MSE. ¿Qué relación establece entre minimizar el error cuadrático medio y la fórmula de la pendiente? Contrastarlo con la Proposición 13.2, que minimiza la suma sin dividir entre n: ¿por qué da lo mismo?
  2. §10.5 Visualizing Uncertainty dibuja muchas rectas ajustadas a remuestreos. ¿Qué técnica de la lección 11 es esa, y qué cantidad de la lección 14 está estimando?
  3. §10.6 Transformation ajusta una recta tras transformar una de las variables. ¿Qué supuesto de la Definición 13.1 se está intentando rescatar con eso, y cuál de los cuatro casos del visual de la sección 4 se arreglaría así?

Para el Cerebro

Nota nueva en 10-Conceptos/regresion-lineal.md, enlazada a [[minimos-cuadrados]], [[covarianza-correlacion]] y [[maxima-verosimilitud]]. La demostración de la Proposición 13.6 conviene hacerla a mano: es la que enseña que la ortogonalidad no es un accidente sino la condición que define el ajuste.

¿Cuál es el modelo de regresión lineal simple?::y = β₀ + β₁x + ε, con los ε independientes, de media cero y varianza constante
¿Qué cuatro supuestos lleva escondidos?::Linealidad, independencia de los errores, varianza constante, y media cero para todo x
¿Cuánto vale la pendiente estimada?::Cov(x,y)/Var(x), que también es r·sy/sx
¿Qué pasa si se estandarizan las dos variables?::La pendiente es exactamente r. La correlación es la pendiente en unidades estandarizadas
¿Por dónde pasa siempre la recta de mínimos cuadrados?::Por el punto (x̄, ȳ). Sale de la primera ecuación normal
¿Hay una recta de regresión o dos?::Dos. La de y sobre x y la de x sobre y no coinciden salvo si |r| = 1
¿Cuánto vale el producto de sus pendientes?::r²
¿Qué es la regresión a la media?::Que un valor extremo de x predice un valor menos extremo de y, porque la pendiente estandarizada es r < 1
¿Es un fenómeno causal?::No. Es aritmética: aparece igual midiendo hacia atrás en el tiempo, donde ninguna causa puede actuar
¿Qué dice la descomposición SCT = SCR + SCE?::Que la varianza total se parte en la explicada por la recta más la que queda
¿Por qué se anula el término cruzado?::Porque las ecuaciones normales dicen que los residuos son ortogonales a x y a la constante. Es la proyección de Mat 05
¿Cuánto vale R² en regresión simple?::r², el cuadrado de la correlación
¿Un R² alto garantiza que el modelo es correcto?::No. Se puede tener R² alto con relación curva, varianza creciente o un punto atípico mandando
¿Qué hay que mirar entonces?::El gráfico de residuos contra x: si hay curvatura, abanico o un punto despegado, el modelo no vale
¿Los residuos suman cero es buena señal?::No es señal de nada. Es una identidad que sale de la primera ecuación normal y se cumple siempre
¿Qué diferencia hay entre eᵢ y εᵢ?::εᵢ es el error verdadero del modelo, que no se ve; eᵢ es el residuo calculado. Los εᵢ son independientes, los eᵢ no

Fuentes

Lo que esta página demuestra sola. Las Proposiciones 13.2, 13.3, 13.4 y 13.6 se demuestran aquí, a partir de la Proposición 5.4 (Cauchy-Schwarz), la Proposición 5.5, la Definición 5.6 y la Proposición 5.9. Las tres se comprueban además numéricamente: las tres formas de la pendiente coinciden a 10^{-14}, el producto de pendientes da r^2 en cinco correlaciones distintas, y la identidad SCT = SCR + SCE cuadra en los tres conjuntos de la sección 4 —incluidos los que rompen el modelo—. Los tres visuales se contrastaron contra numpy antes de publicarse.

Lo que se usa de otras lecciones sin repetir. Que minimizar la suma de cuadrados equivale a máxima verosimilitud bajo errores normales es la Proposición 8.8, demostrada allí. Que el ajuste es una proyección ortogonal es la Matemática 6; aquí solo se reescribe en sumas.

Lo que viene de los libros.

  • Think Stats 3e (Downey, CC BY-NC-SA 4.0), §10.7 Glossary — citadas textualmente las definiciones de linear least squares fit y coefficient of determination.

Lo que es mío, no del libro. La numeración de definiciones y proposiciones. La insistencia en las dos rectas como consecuencia de la Proposición 5.9, la lectura de la regresión a la media como aritmética y no como fenómeno, el argumento de que «los residuos suman cero» es una identidad y no una comprobación, y los cuatro casos de R^2 parecido con supuestos rotos distintos, son forma de presentarlo. Think Stats construye la distribución de los coeficientes por remuestreo y no deriva las ecuaciones normales.

Índices verificados el 12-09-2026 contra el índice publicado del libro.

→ Siguiente: Inferencia sobre los coeficientes