Inferencia sobre los coeficientes
Estadística · Lección 14
Objetivo
Al terminar esta lección se puede:
- Derivar la distribución muestral exacta de \hat{\beta}_1 bajo el modelo normal de la lección 13, y su error estándar.
- Explicar por qué el estadístico de \hat{\beta}_1 sigue una t de Student con n-2 grados de libertad, no n-1.
- Construir el intervalo de confianza y la prueba de hipótesis para \beta_1, y leer el valor p que cualquier salida de regresión imprime junto a cada coeficiente.
- Mostrar que sustituir el cuantil t por el cuantil z daña la cobertura igual que en la lección 9, y que el daño es peor cuanto menor es n.
De dónde viene
- Estadística 13: el modelo y_i = \beta_0+\beta_1x_i+\varepsilon_i, el estimador \hat{\beta}_1 de la Proposición 13.2 y la suma de cuadrados del error SCE. Aquí se les pone una distribución y, con ella, incertidumbre.
- Estadística 12: la construcción de la t de Student como Z/\sqrt{W/\nu} (Teorema 12.5), con la deuda del teorema de Cochran. Esa misma deuda se vuelve a contraer aquí, con n-2 en vez de n-1.
- Estadística 9: el método del pivote para construir un intervalo de confianza (Proposición 9.3), y que sustituir \sigma por su estimador sin cambiar el cuantil rompe la cobertura (Proposición 9.7). La Proposición 14.6 es ese mismo argumento, aplicado a \hat{\beta}_1.
- Estadística 10: la Proposición 10.8 —el valor p es uniforme bajo H_0— es lo que hace válida la prueba sobre \beta_1.
Para qué sirve después
- Lección 15: qué le pasa a \hat{\beta}_1 y a su error estándar cuando faltan datos —el problema deja de ser solo «menos datos» y pasa a depender de por qué faltan.
- Lección 17: la Proposición 10.9 (pruebas múltiples) aplicada a una tabla de coeficientes: probar muchos a la vez infla la tasa de falsos hallazgos.
- ISLP cap. 3: la misma fórmula del error estándar, en forma matricial, sirve para cualquier número de predictores.
- Aprendizaje automático: por qué un coeficiente «significativo» no es lo mismo que un coeficiente útil para predecir.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| \text{SCX} | ese ce equis | \sum_i(x_i-\bar{x})^2, la dispersión de los x_i que ya aparecía en la Proposición 13.2 |
| \hat{\sigma}^2 | sigma sombrero cuadrado | \text{SCE}/(n-2), el estimador insesgado de \sigma^2 |
| \text{EE}(\hat{\beta}_1) | e-e de beta uno sombrero | La desviación típica estimada de \hat{\beta}_1: \hat{\sigma}/\sqrt{\text{SCX}} |
| \text{EE}(\hat{\beta}_0) | e-e de beta cero sombrero | Análoga para \hat{\beta}_0: \hat{\sigma}\sqrt{1/n + \bar{x}^2/\text{SCX}} |
| T | te | (\hat{\beta}_1-\beta_1)/\text{EE}(\hat{\beta}_1); bajo H_0:\beta_1=0, se reduce a \hat{\beta}_1/\text{EE}(\hat{\beta}_1) |
| \text{gl} | ge ele | Grados de libertad, n-2 aquí: se estimaron dos coeficientes antes de llegar al residuo |
\hat{\sigma}^2 divide entre n-2 y no entre n-1 por la misma razón que s^2 dividía entre n-1 en la lección 4: cada coeficiente ajustado consume un grado de libertad de los residuos. Con dos coeficientes, quedan n-2.
1. La distribución muestral de \hat{\beta}_1
La Proposición 13.2 dio una fórmula para \hat{\beta}_1; no dijo qué tan lejos puede caer de \beta_1. Para eso hace falta el modelo completo de la Definición 13.1, con los errores además normales.
Proposición 14.2 (distribución de los coeficientes). Bajo el modelo de la Definición 13.1 con \varepsilon_i \sim \mathcal{N}(0,\sigma^2) independientes, \hat{\beta}_1 \sim \mathcal{N}\!\left(\beta_1,\; \frac{\sigma^2}{\text{SCX}}\right), \qquad \hat{\beta}_0 \sim \mathcal{N}\!\left(\beta_0,\; \sigma^2\Big(\frac{1}{n}+\frac{\bar{x}^2}{\text{SCX}}\Big)\right).
Demostración. Sea c_i = (x_i-\bar{x})/\text{SCX}. La Proposición 13.2 escribe \hat{\beta}_1 como \hat{\beta}_1 = \sum_i c_i y_i = \sum_i c_i(\beta_0+\beta_1x_i+\varepsilon_i) = \beta_0\sum_i c_i + \beta_1\sum_i c_ix_i + \sum_i c_i\varepsilon_i. Dos sumas se anulan o valen uno: \sum_i c_i = \frac{1}{\text{SCX}}\sum_i(x_i-\bar{x}) = 0, y \sum_i c_ix_i = \frac{1}{\text{SCX}}\sum_i(x_i-\bar{x})x_i = \frac{1}{\text{SCX}}\sum_i(x_i-\bar{x})^2 = 1 —porque \sum_i(x_i-\bar{x})\bar{x}=0—. Queda \hat{\beta}_1 = \beta_1 + \sum_i c_i\varepsilon_i. \hat{\beta}_1 es entonces una combinación lineal de los \varepsilon_i, que son normales e independientes: por cerradura de la normal bajo combinaciones lineales, \hat{\beta}_1 es normal. Su media es \beta_1 —el segundo sumando tiene media cero— y su varianza es \text{Var}(\hat{\beta}_1) = \sum_i c_i^2\,\text{Var}(\varepsilon_i) = \sigma^2\sum_i c_i^2 = \frac{\sigma^2}{\text{SCX}^2}\sum_i(x_i-\bar{x})^2 = \frac{\sigma^2}{\text{SCX}}.
Para \hat{\beta}_0, sea d_i = 1/n - \bar{x}c_i. De \hat{\beta}_0 = \bar{y}-\hat{\beta}_1\bar{x} y \bar{y}=\frac{1}{n}\sum_i y_i sale \hat{\beta}_0 = \sum_i d_i y_i, con \sum_i d_i = 1 y \sum_i d_ix_i=0 —la misma cuenta que para c_i—, así que por el mismo argumento \hat{\beta}_0 es normal de media \beta_0 y varianza \sigma^2\sum_i d_i^2. Expandiendo el cuadrado y usando \sum_ic_i=0, \sum_ic_i^2=1/\text{SCX}: \sum_i d_i^2 = \sum_i\Big(\frac{1}{n}-\bar{x}c_i\Big)^2 = \frac{1}{n} - \frac{2\bar{x}}{n}\sum_ic_i + \bar{x}^2\sum_ic_i^2 = \frac{1}{n}+\frac{\bar{x}^2}{\text{SCX}}. ∎
Dos lecturas inmediatas. La primera: \text{Var}(\hat{\beta}_1) baja con SCX, es decir, con cuánto se separan los x_i entre sí —no con cuántos son—. Duplicar el rango de x reduce la varianza quince o veinte veces más que duplicar n con el mismo rango; es la razón por la que un buen diseño experimental separa los niveles de x todo lo que se pueda. La segunda: esta es la varianza si \sigma se conociera. Casi nunca se conoce, y ahí empieza el problema de esta lección.
El panel izquierdo no se mueve al cambiar n, y no es un descuido: Z=(\hat{\beta}_1-\beta_1)/(\sigma/\sqrt{\text{SCX}}) es exactamente normal estándar para cualquier n, por la Proposición 14.2. El panel derecho sí se mueve, porque T usa \hat\sigma en vez de \sigma, y esa sustitución es exactamente lo que cuesta grados de libertad: cuanto menor el n, peor estimado \hat\sigma, más ancha la cola de T.
2. Grados de libertad: por qué n-2
\sigma casi nunca se conoce. Hay que estimarla de los residuos, y eso tiene un costo.
Proposición 14.3 (independencia). Bajo el modelo de la Definición 13.1 con errores normales, \hat{\beta}_1 es independiente del vector de residuos (e_1,\dots,e_n) —y por tanto de \hat\sigma^2, que es una función de ese vector.
Demostración. De la Proposición 14.2, e_i = y_i-\hat\beta_0-\hat\beta_1x_i se puede escribir como e_i = (\varepsilon_i-\bar\varepsilon) - (\hat\beta_1-\beta_1)(x_i-\bar{x}) —restando el modelo verdadero y usando \hat\beta_1-\beta_1=\sum_jc_j\varepsilon_j—. Calculando la covarianza con \hat\beta_1: \text{Cov}(\hat\beta_1, \varepsilon_i) = \text{Cov}\Big(\sum_jc_j\varepsilon_j,\,\varepsilon_i\Big) = c_i\sigma^2, \qquad \text{Cov}(\hat\beta_1,\bar\varepsilon) = \frac{\sigma^2}{n}\sum_jc_j = 0 —la segunda se anula porque \sum_jc_j=0, la misma suma de la Proposición 14.2—. Entonces \text{Cov}(\hat\beta_1, e_i) = \text{Cov}(\hat\beta_1,\varepsilon_i) - \text{Cov}(\hat\beta_1,\bar\varepsilon) - (x_i-\bar{x})\,\text{Var}(\hat\beta_1) = c_i\sigma^2 - 0 - (x_i-\bar{x})\frac{\sigma^2}{\text{SCX}} = 0, porque (x_i-\bar{x})/\text{SCX} = c_i. La covarianza es cero para todo i. Como \hat\beta_1 y cada e_i son combinaciones lineales del mismo vector normal (\varepsilon_1,\dots,\varepsilon_n), son conjuntamente normales, y covarianza cero entre normales conjuntas implica independencia —el mismo argumento de la Proposición 12.4—. Por tanto \hat\beta_1 es independiente del vector (e_1,\dots,e_n) completo, y de cualquier función suya, en particular \text{SCE}=\sum_ie_i^2 y \hat\sigma^2=\text{SCE}/(n-2). ∎
Proposición 14.4 (insesgadez de \hat\sigma^2). E[\hat\sigma^2] = \sigma^2.
Demostración. De la identidad e_i = (\varepsilon_i-\bar\varepsilon) - (\hat\beta_1-\beta_1)(x_i-\bar{x}) usada arriba, elevando al cuadrado y sumando en i —el término cruzado usa \sum_i(\varepsilon_i-\bar\varepsilon)(x_i-\bar{x}) = \sum_i\varepsilon_i(x_i-\bar{x}) = \text{SCX}\cdot(\hat\beta_1-\beta_1), la misma suma de la Proposición 14.2—: \text{SCE} = \sum_i(\varepsilon_i-\bar\varepsilon)^2 - \text{SCX}\,(\hat\beta_1-\beta_1)^2. Tomando esperanza: E\big[\sum_i(\varepsilon_i-\bar\varepsilon)^2\big] = (n-1)\sigma^2 por la Proposición 4.10 —los \varepsilon_i son independientes de media cero y varianza \sigma^2, exactamente sus hipótesis—, y E\big[\text{SCX}(\hat\beta_1-\beta_1)^2\big] = \text{SCX}\cdot\text{Var}(\hat\beta_1) = \text{SCX}\cdot\sigma^2/\text{SCX} = \sigma^2 por la Proposición 14.2. Entonces E[\text{SCE}] = (n-1)\sigma^2 - \sigma^2 = (n-2)\sigma^2, \qquad E[\hat\sigma^2] = E[\text{SCE}]/(n-2) = \sigma^2. ∎
La cuenta explica el nombre «grados de libertad» sin metáfora: de los n residuos, ajustar \hat\beta_0 y \hat\beta_1 consume dos —la identidad de arriba le resta a la variación total de los errores exactamente \sigma^2 por cada coeficiente estimado, no solo por \hat\beta_1: el primero ya estaba escondido en el paso de \sum(\varepsilon_i-\bar\varepsilon)^2 en vez de \sum\varepsilon_i^2, que es la misma resta que hace la Proposición 4.10 para s^2—.
Con la independencia y la insesgadez en la mano, se puede cerrar la cuenta de la lección 12.
Teorema 14.5 (cerrando la deuda, otra vez). Bajo el modelo de la Definición 13.1 con errores normales:
- \dfrac{(n-2)\hat\sigma^2}{\sigma^2} \sim \chi^2_{n-2};
- \hat\beta_1 y \hat\sigma^2 son independientes;
- por tanto T = \dfrac{\hat\beta_1-\beta_1}{\text{EE}(\hat\beta_1)} = \dfrac{Z}{\sqrt{W/(n-2)}} con Z=(\hat\beta_1-\beta_1)/(\sigma/\sqrt{\text{SCX}}) \sim \mathcal{N}(0,1) y W=(n-2)\hat\sigma^2/\sigma^2 \sim \chi^2_{n-2} independientes, y ese cociente es la t de Student con n-2 grados de libertad.
Demostración. El apartado (2) es la Proposición 14.3. El (3) es álgebra: dividiendo numerador y denominador de T entre \sigma/\sqrt{\text{SCX}}, T = \frac{(\hat\beta_1-\beta_1)/(\sigma/\sqrt{\text{SCX}})}{\hat\sigma/\sigma} = \frac{Z}{\sqrt{\dfrac{(n-2)\hat\sigma^2/\sigma^2}{n-2}}}, que tiene la forma anunciada. El apartado (1) no se demuestra aquí: hace falta el teorema de Cochran, la misma pieza que faltaba en el Teorema 12.5. Ahí descomponía \|\mathbf{x}-\mu\mathbf{1}\|^2 en dos piezas ortogonales; aquí descompone los residuos de la regresión en la misma forma, con dos dimensiones consumidas en vez de una. ∎
Los cuantiles de T salen por encima de los de una normal estándar, y \text{corr}(\hat\beta_1,\hat\sigma^2) sale prácticamente cero: la misma comprobación numérica de la Proposición 12.4, aplicada a los coeficientes.
3. Intervalos y pruebas sobre \beta_1
Con el Teorema 14.5 en la mano, el argumento es exactamente el de la Proposición 9.3.
Proposición 14.6 (intervalo de confianza y prueba para \beta_1). Sea t_{\text{gl},\alpha/2} el valor que deja \alpha/2 de probabilidad en cada cola de una t_{\text{gl}}. Entonces:
- P\big(\hat\beta_1 - t_{\text{gl},\alpha/2}\,\text{EE}(\hat\beta_1) \le \beta_1 \le \hat\beta_1 + t_{\text{gl},\alpha/2}\,\text{EE}(\hat\beta_1)\big) = 1-\alpha;
- bajo H_0:\beta_1=0, el estadístico T_0 = \hat\beta_1/\text{EE}(\hat\beta_1) sigue una t_\text{gl}, y el valor p de la prueba bilateral es 2\big(1-P(|T_\text{gl}|\le|T_0|)\big).
Demostración. Para (1): \big|\hat\beta_1-\beta_1\big| \le t_{\text{gl},\alpha/2}\,\text{EE}(\hat\beta_1) \iff |T|\le t_{\text{gl},\alpha/2}, y por el Teorema 14.5, T\sim t_\text{gl}, así que esa probabilidad es exactamente 1-\alpha por definición del cuantil. Para (2): con \beta_1=0, T del Teorema 14.5 coincide con T_0, y por la Proposición 10.8 —el valor p es uniforme bajo H_0 cuando el estadístico tiene distribución continua, que t_\text{gl} lo es— la fórmula del enunciado es válida. ∎
Esto es exactamente lo que imprime cualquier salida de regresión junto a cada coeficiente: la columna «Std. Error» es \text{EE}(\hat\beta_1), la columna «t value» es T_0, y la columna «Pr(>|t|)» es el valor p de (2). Nada de eso es una caja negra: es la Proposición 9.3 y la Proposición 10.8, aplicadas al mismo pivote de siempre.
La lectura es idéntica a la de la Proposición 9.7, con \hat\beta_1 en el lugar de \bar{x}: la curva de z con \sigma conocida está en el nominal porque ahí no hay nada que estimar; la de z con \hat\sigma está por debajo, porque el cuantil no compensa la incertidumbre extra de estimar \sigma; la de t con \hat\sigma vuelve al nominal, porque el cuantil t_\text{gl} está definido justamente para eso.
Con \text{gl}=2 (n=4) la cobertura nominal del 95 % usando z cae a poco más del 80 %: uno de cada cinco intervalos falla en vez de uno de cada veinte. Es el mismo agujero que la Proposición 9.7 midió para la media, y la razón es la misma: la t tiene colas más pesadas que la normal.
Ejercicios
Ejercicio 1 — El ejemplo de la lección 13, con incertidumbre
Retomar el conjunto de doce puntos de la lección 13 y calcular \text{EE}(\hat\beta_1), \text{EE}(\hat\beta_0), el estadístico T_0 de cada uno bajo H_0:\beta=0, y el intervalo de confianza al 95 % para \beta_1. Contrastar contra la fórmula matricial (X^\top X)^{-1}, sin usar ninguna librería de regresión.
El T_0 de \hat\beta_1 sale por encima de 12: con \text{gl}=10, un valor así de extremo bajo H_0:\beta_1=0 tiene una probabilidad menor a una en un millón. La pendiente de la lección 13 no es solo distinta de cero en esta muestra: la evidencia en contra de H_0 es abrumadora.
Ejercicio 2 — SCX manda más que n
Comparar \text{EE}(\hat\beta_1) en dos diseños con el mismo n=20 y el mismo \sigma: uno con los x_i repartidos en [0,10] y otro con los x_i repartidos en [4,6]. Confirmar que la razón entre los dos errores estándar es la raíz de la razón entre los dos \text{SCX}.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 14:
- Escribir
ajusta_con_inferencia(x, y)que devuelva \hat\beta_0,\hat\beta_1, sus errores estándar, sus estadísticos T, sus valores p y el intervalo de confianza al 95 % de \beta_1 —sinstatsmodelsniscipy—. Probarla contra la fórmula matricial (X^\top X)^{-1}\hat\sigma^2 sobre mil conjuntos aleatorios y devolver el mayor error absoluto. - Simular 20 000 veces el modelo con \beta_1=0 conocido y registrar cuántas veces H_0:\beta_1=0 se rechaza al 5 %. Comparar con el 5 % nominal. Repetir con \beta_1\ne 0 y graficar la fracción de rechazos —la potencia— en función de n.
- Tomar el conjunto de la lección 13 con varianza creciente (el segundo caso de su sección 4) y calcular \text{EE}(\hat\beta_1) con la fórmula de esta lección. Comparar contra el error estándar real, medido por simulación remuestreando los residuos con reemplazo. ¿Cuánto se equivoca la fórmula cuando el supuesto de varianza constante se rompe?
Del libro
Think Stats se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.
The standard error of the estimate is the standard deviation of the sampling distribution.
Downey, Think Stats 3e, §10.4 Estimation
The result is a sample from the sampling distribution of the slope.
Downey, Think Stats 3e, §10.4 Estimation
Las dos frases describen exactamente \text{EE}(\hat\beta_1) y la Proposición 14.2, pero por un camino distinto: TS 3e obtiene la distribución muestral de \hat\beta_1 remuestreando —bootstrap, la lección 11— y midiendo la desviación típica de las pendientes resultantes, sin nunca escribir \sigma^2/\text{SCX} ni invocar la t de Student. Las dos rutas llegan al mismo error estándar cuando el modelo es correcto; la de este curso da además la forma exacta de la distribución para n pequeño, que el bootstrap solo aproxima.
Preguntas para leer §10 con lápiz:
- §10.4 Estimation usa
percentilesobre muchas pendientes remuestreadas para construir un intervalo de confianza. ¿Qué tiene que cumplirse para que ese intervalo y el de la Proposición 14.6 —construido con \hat\beta_1 \pm t_\text{gl,\alpha/2}\text{EE}(\hat\beta_1)— se parezcan? ¿Qué pasa si n es muy chico? - §10.5 Visualizing Uncertainty dibuja muchas rectas ajustadas a remuestreos y una banda de confianza para la predicción, no para la pendiente. ¿En qué se diferencia esa banda del intervalo de esta lección para \beta_1?
- El glosario de §10.7 no tiene entrada para «grados de libertad» ni para «distribución t». ¿Por qué un libro que resuelve todo por remuestreo no necesita esos dos conceptos?
Para el Cerebro
Nota nueva en 10-Conceptos/inferencia-coeficientes.md, enlazada a [[regresion-lineal]], [[intervalo-de-confianza]] y [[distribucion-t-de-student]]. La Proposición 14.3 conviene hacerla a mano: es la que explica, sin apelar a Cochran, por qué la incertidumbre de la pendiente y la del residuo no se contaminan entre sí.
¿De qué distribución es $\hat\beta_1$ bajo el modelo normal?::Normal, media β1 y varianza σ²/SCX (Proposición 14.2)
¿Por qué baja Var(b1_hat) al separar los x_i?::Porque SCX crece; separar los x_i importa más que aumentar n
¿Por qué σ̂² divide entre n−2 y no entre n−1?::Porque se estimaron dos coeficientes, β̂0 y β̂1, antes de llegar al residuo
¿Es σ̂² insesgado para σ²?::Sí, E[σ̂²] = σ² (Proposición 14.4), sin necesitar el teorema de Cochran
¿Qué parte de la construcción de T sí necesita Cochran?::Que (n−2)σ̂²/σ² sigue exactamente una χ²ₙ₋₂, no solo que tiene esa media y varianza
¿Qué distribución tiene T = (b1_hat − β1)/EE(b1_hat)?::Una t de Student con n−2 grados de libertad
¿Cómo se construye el intervalo de confianza para β1?::b1_hat ± t_(gl,α/2) · EE(b1_hat), el mismo pivote de la lección 9
¿Qué mide el estadístico T0 bajo H0: β1=0?::b1_hat / EE(b1_hat); su valor p sale de la Proposición 10.8
¿Qué pasa si se usa el cuantil z en vez del cuantil t?::La cobertura se queda corta, más cuanto menor es n — el mismo fallo de la Proposición 9.7
¿Qué son las columnas Std. Error, t value y Pr(>|t|) de una salida de regresión?::EE(b_j), T0 de cada coeficiente, y su valor p bajo H0: β_j=0
Fuentes
Lo que esta página demuestra sola. Las Proposiciones 14.2, 14.3, 14.4 y 14.6 se demuestran aquí, a partir de la Proposición 13.2 (los coeficientes), la Proposición 4.10 (insesgadez de s^2), la Proposición 12.4 y el Teorema 12.5 (la construcción de la t y su covarianza cero), y la Proposición 10.8 (el valor p es uniforme bajo H_0). Se comprueban además numéricamente: la media y varianza de W=(n-2)\hat\sigma^2/\sigma^2 contra \chi^2_{n-2}, la correlación entre \hat\beta_1 y \hat\sigma^2 cerca de cero, los cuantiles de T contra los de una normal, y el ejemplo de la lección 13 contrastado contra la fórmula matricial (X^\top X)^{-1}. Los dos visuales se contrastaron contra numpy antes de publicarse: 3 combinaciones de n para la distribución de Z y T, y 7 tamaños de muestra por 3 niveles de confianza para la cobertura.
Lo que se usa de otras lecciones sin repetir. Que la normal es cerrada bajo combinaciones lineales y que covarianza cero entre normales conjuntas implica independencia es el mismo argumento de la Proposición 12.4. Que el valor p es uniforme bajo H_0 es la Proposición 10.8. El método del pivote para construir el intervalo es la Proposición 9.3.
Lo que se enuncia sin demostrar. El apartado (1) del Teorema 14.5 —que (n-2)\hat\sigma^2/\sigma^2 sigue exactamente una \chi^2_{n-2}— se usa sin demostración; hace falta el teorema de Cochran, la misma deuda contraída en el Teorema 12.5. Se comprueba numéricamente por sus dos primeros momentos, que no es lo mismo que demostrarlo.
Lo que viene de los libros.
- Think Stats 3e (Downey, CC BY-NC-SA 4.0), §10.4 Estimation — citadas textualmente dos frases sobre el error estándar y la distribución muestral de la pendiente.
Lo que es mío, no del libro. La numeración de definiciones y proposiciones. La derivación completa de \text{Var}(\hat\beta_1) y \text{Var}(\hat\beta_0) como combinaciones lineales de los errores, la prueba de independencia de \hat\beta_1 y \hat\sigma^2 por covarianza cero —sin invocar Cochran para esa parte—, y la identidad \text{SCE} = \sum_i(\varepsilon_i-\bar\varepsilon)^2 - \text{SCX}(\hat\beta_1-\beta_1)^2 que prueba la insesgadez de \hat\sigma^2, son forma de presentarlo. Think Stats obtiene la distribución muestral de \hat\beta_1 por remuestreo (§10.4–10.5) y no deriva ni el error estándar en forma cerrada ni la distribución t de los coeficientes.
Índices verificados el 12-09-2026 contra el índice publicado del libro.