Estimación: sesgo, varianza y consistencia
Estadística · Lección 7
Objetivo
Al terminar esta lección se puede:
- Definir estimador, sesgo y varianza de un estimador, y calcular los tres para casos concretos.
- Demostrar la descomposición del error cuadrático medio en sesgo al cuadrado más varianza.
- Explicar por qué un estimador sesgado puede ser preferible a uno insesgado.
- Definir consistencia y distinguirla de la insesgadez.
De dónde viene
- Lección 1: la distribución muestral (Definición 1.6) es el objeto sobre el que se define todo aquí.
- Lección 4: la Proposición 4.10 demostró que s^2 es insesgada. Esta lección da el marco general del que ese resultado es un caso.
- Lección 6: el teorema central del límite describe la forma de esa distribución muestral cuando n es grande.
Para qué sirve después
- Lección 8: la máxima verosimilitud es un método para construir estimadores; aquí se establecen los criterios para juzgarlos.
- Lección 9: un intervalo de confianza se construye a partir de la distribución muestral de un estimador.
- Lección 11: el bootstrap estima la varianza de un estimador cuando no hay fórmula.
- ISLP cap. 2: la descomposición sesgo–varianza del error de predicción es la Proposición 7.5 de aquí, aplicada a una predicción en vez de a un parámetro. Es el argumento central de todo el aprendizaje automático.
- ISLP cap. 6: ridge y lasso introducen sesgo a propósito para reducir varianza. Sin esta lección esa decisión no se entiende.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| \theta | theta | El parámetro verdadero y desconocido que se quiere estimar |
| \hat{\theta} | theta sombrero | Un estimador: una fórmula aplicada a la muestra |
| \hat{\theta}_n | theta sombrero sub ene | El mismo estimador, calculado con n datos |
| E[\hat{\theta}] | esperanza de theta sombrero | El promedio del estimador sobre todas las muestras posibles |
| \text{Sesgo}(\hat{\theta}) | sesgo | E[\hat{\theta}] - \theta |
| \text{ECM}(\hat{\theta}) | e ce eme | Error cuadrático medio, E[(\hat{\theta}-\theta)^2] |
| \xrightarrow{P} | converge en probabilidad | La convergencia de la Definición 7.6 |
| c^{*} | ce estrella | El valor de c que minimiza el ECM del estimador encogido |
El sombrero marca siempre lo mismo: una cantidad calculada a partir de los datos, en oposición a la cantidad verdadera que lleva letra griega desnuda. \theta es un número fijo aunque desconocido; \hat{\theta} es una variable aleatoria, porque depende de qué muestra tocó.
1. Estimadores
Definición 7.1 (estimador). Una función de la muestra usada para aproximar un parámetro de la población. Al ser función de datos aleatorios, es una variable aleatoria y tiene su propia distribución, que es la distribución muestral de la Definición 1.6.
A statistic, like the sample mean or median, that’s used to estimate a property of a population is called an estimator.
Downey, Think Stats 3e, §8.8 Glossary
Un mismo parámetro admite varios estimadores. Para la media de una población se puede usar la media muestral, la mediana, la semisuma del mínimo y el máximo, o el primer dato de la lista. Todos son estimadores legítimos según la Definición 7.1. El resto de la lección construye los criterios para ordenarlos.
2. Sesgo
Definición 7.2 (sesgo). \text{Sesgo}(\hat{\theta}) = E[\hat{\theta}] - \theta. El estimador es insesgado si el sesgo vale cero, es decir, si E[\hat{\theta}] = \theta.
An estimator is unbiased if, for a particular sample size, the average of the sample estimates is the actual value.
Downey, Think Stats 3e, §8.8 Glossary
La frase «para un tamaño de muestra dado» no sobra: la insesgadez es una propiedad que se cumple o no para cada n por separado, no en el límite. Insesgado no significa que un cálculo concreto acierte —casi nunca acierta— sino que el promedio sobre todas las muestras posibles cae sobre el valor verdadero.
Proposición 7.3. Para una muestra i.i.d. de una población con media \mu y varianza \sigma^2 finitas:
- \bar{x} es insesgado para \mu.
- s^2 = \frac{1}{n-1}\sum(x_i-\bar{x})^2 es insesgado para \sigma^2.
- s = \sqrt{s^2} es sesgado para \sigma, y subestima.
Demostración. (1) Es la Proposición 6.1: E[\bar{X}_n] = \mu.
Es la Proposición 4.10.
La varianza de s es positiva siempre que la población no sea degenerada, así que por la Proposición 4.7 aplicada a la variable aleatoria s: E[s^2] = \big(E[s]\big)^2 + \text{Var}(s) \;>\; \big(E[s]\big)^2. Por la parte (2), el lado izquierdo vale \sigma^2, de modo que \sigma^2 > (E[s])^2 y, tomando raíces, E[s] < \sigma. ∎
La parte (3) contiene una advertencia general: la insesgadez no sobrevive a las transformaciones no lineales. Que s^2 sea insesgado para \sigma^2 no implica nada sobre s y \sigma. Por eso el estimador de la desviación estándar que devuelve cualquier programa subestima ligeramente, y casi nadie lo corrige.
3. Un estimador insesgado puede ser malo
Definición 7.4 (error cuadrático medio). \text{ECM}(\hat{\theta}) = E\big[(\hat{\theta}-\theta)^2\big].
The average squared difference between estimated and true parameter values, assuming the true value is known.
Downey, Think Stats 3e, §8.8 Glossary
El ECM mide lo que realmente importa: cuánto se equivoca el estimador en promedio, contando tanto la desviación sistemática como la inestabilidad. La proposición siguiente lo separa en esas dos partes y es, probablemente, el resultado más usado de toda la estadística aplicada.
Proposición 7.5 (descomposición sesgo–varianza). \text{ECM}(\hat{\theta}) = \big[\text{Sesgo}(\hat{\theta})\big]^2 + \text{Var}(\hat{\theta}).
Demostración. Escribiendo m = E[\hat{\theta}], se suma y se resta m dentro del cuadrado: \text{ECM} = E\big[(\hat{\theta}-\theta)^2\big] = E\Big[\big((\hat{\theta}-m) + (m-\theta)\big)^2\Big]. Se expande el cuadrado del binomio y se aplica la linealidad de la esperanza (Proposición 4.4): = E\big[(\hat{\theta}-m)^2\big] + 2\,(m-\theta)\,E\big[\hat{\theta}-m\big] + (m-\theta)^2. El primer término es \text{Var}(\hat{\theta}) por la Definición 4.5. El segundo se anula, porque E[\hat{\theta}-m] = m - m = 0; nótese que (m-\theta) sale fuera de la esperanza por ser una constante. El tercero es el sesgo al cuadrado, por la Definición 7.2. ∎
El término que se anula merece un segundo vistazo, porque es el mismo hecho que la Proposición 5.3: la covarianza es un producto interno, y dos variables con covarianza cero son perpendiculares en ese producto. Aquí \hat{\theta}-m tiene media cero y m-\theta es una constante, así que su producto tiene esperanza cero: los dos errores son perpendiculares. La Proposición 7.5 es entonces el teorema de Pitágoras, con \sqrt{\text{ECM}} como hipotenusa y el sesgo y la desviación típica como catetos.
El visual mueve los dos catetos por separado. La recta de la izquierda muestra dónde caen las estimaciones; el triángulo de la derecha es el mismo par de números en ángulo recto.
Con sesgo cero el triángulo se aplana hasta ser un segmento vertical y \sqrt{\text{ECM}} coincide con la desviación típica. Con desviación cero pasa lo contrario: el estimador acierta siempre el mismo valor equivocado. Los dos extremos son malos por razones distintas, y la hipotenusa es la única cantidad que los mide a la vez.
Lo que la proposición permite ver es que hay dos formas distintas de equivocarse, y se pueden intercambiar. Un estimador insesgado con mucha varianza puede tener un ECM mayor que uno con algo de sesgo y poca varianza.
El visual compara tres estimadores de la media de una población: la media muestral, la mediana, y un estimador que encoge la media hacia cero multiplicándola por un factor c \le 1. Las dos poblaciones disponibles tienen la misma media \mu = 1 y casi la misma desviación típica \sigma = 2; lo único que cambia entre ellas es la forma de la cola, de modo que cualquier diferencia en el ECM viene de ahí y no de la escala.
Conviene leerlo en dos pasadas. Con c = 1 el tercer estimador coincide con la media muestral y la comparación queda entre las dos primeras filas: con población normal gana la media —insesgada y con menos varianza que la mediana—, y al cambiar a la cola pesada gana la mediana, que también es insesgada aquí por simetría. Toda su ventaja es de varianza, porque ignora los valores extremos.
La segunda pasada es bajar c. Encoger la media hacia cero introduce sesgo a propósito, y con población normal el ECM del tercer estimador cae por debajo del de la media muestral para los tres valores de n. Contra la cola pesada no alcanza: la mediana sigue ganando, porque el problema ahí no es de escala sino de valores extremos, y multiplicar por c no los quita. Encoger es un mecanismo contra la varianza, no contra las colas.
4. Consistencia
Insesgadez y ECM pequeño son propiedades para un n fijo. La consistencia es una propiedad del comportamiento cuando n crece.
Definición 7.6 (consistencia). \hat{\theta}_n es consistente si converge en probabilidad a \theta, es decir, si para todo \varepsilon > 0 P\big(|\hat{\theta}_n - \theta| > \varepsilon\big) \longrightarrow 0 \qquad\text{cuando } n \to \infty.
Proposición 7.7. Si \text{ECM}(\hat{\theta}_n) \to 0, entonces \hat{\theta}_n es consistente.
Demostración. Por la desigualdad de Markov aplicada a la variable no negativa (\hat{\theta}_n-\theta)^2, para todo \varepsilon > 0: P\big(|\hat{\theta}_n - \theta| > \varepsilon\big) = P\big((\hat{\theta}_n-\theta)^2 > \varepsilon^2\big) \le \frac{E\big[(\hat{\theta}_n-\theta)^2\big]}{\varepsilon^2} = \frac{\text{ECM}(\hat{\theta}_n)}{\varepsilon^2}. Si el numerador tiende a cero, el lado izquierdo también, para cada \varepsilon fijo. ∎
Por la Proposición 7.5, el ECM tiende a cero cuando el sesgo y la varianza tienden a cero por separado. Para \bar{x} el sesgo es cero siempre y la varianza es \sigma^2/n, así que la media muestral es consistente.
Las dos propiedades son independientes, y los cuatro casos existen:
| Insesgado | Sesgado | |
|---|---|---|
| Consistente | \bar{x} para \mu | \hat{\sigma}^2 con denominador n |
| No consistente | El primer dato de la muestra, x_1 | \bar{x} + 3 |
El caso de la esquina inferior izquierda merece atención: tomar siempre x_1 como estimación de \mu es perfectamente insesgado —su esperanza es \mu— y completamente inútil, porque su varianza es \sigma^2 y no baja nunca. Insesgado no significa bueno.
El visual mide el ECM de cuatro estimadores de \mu para n creciente, en ejes logarítmicos —donde \sigma^2/n es una recta de pendiente -1—. En lugar de \hat{\sigma}^2 usa \bar{x}+3/n como segundo ejemplo de la casilla sesgado-consistente, para no cambiar de parámetro a mitad de la gráfica: su sesgo es 3/n, distinto de cero para toda n, pero se desvanece en el límite.
Las dos curvas que bajan lo hacen en paralelo a partir de n \approx 16: el sesgo 3/n de la cuarta se hace despreciable frente a la varianza \sigma^2/n, porque 9/n^2 cae más rápido. Las dos que se estancan lo hacen a alturas distintas —\sigma^2 una, 9+\sigma^2/n la otra— y ninguna cantidad de datos las arregla. Ese es el contenido de la Definición 7.6.
Las dos columnas de sesgo se quedan en cero: los dos estimadores son insesgados para toda n. Las de ECM se separan: la de \bar{x} baja como \sigma^2/n, la de x_1 se queda clavada en \sigma^2 = 4. Solo el primero es consistente.
5. El intercambio, medido
La primera fila, c = 1, es la media muestral: sesgo cero y todo el ECM viene de la varianza. Al bajar c aparece sesgo, pero la varianza baja más deprisa —proporcionalmente a c^2, por la Proposición 4.6— y el ECM total desciende. Pasado cierto punto el sesgo domina y el ECM vuelve a subir.
El mínimo se puede calcular en vez de tantear. Como E[c\bar{x}] = c\mu y \text{Var}(c\bar{x}) = c^2\sigma^2/n, la Proposición 7.5 da \text{ECM}(c) = (c-1)^2\mu^2 + c^2\frac{\sigma^2}{n}, un polinomio de segundo grado en c con coeficiente principal positivo. Derivando e igualando a cero: c^{*} = \frac{\mu^2}{\mu^2 + \sigma^2/n}. El cociente \mu^2 \big/ (\sigma^2/n) es la razón entre la señal que se quiere estimar y el ruido que trae la muestra. Cuando la señal domina, c^{*} se acerca a 1 y no conviene encoger; cuando el ruido domina, c^{*} se acerca a 0 y conviene encoger casi hasta el final. Con los valores de la celda —\mu = 1, \sigma = 2, n = 4— señal y ruido valen lo mismo y c^{*} = 1/2, que es justo donde cae el mínimo de la tabla.
Este ejemplo es el esqueleto de ridge, lasso y de casi toda la regularización de ISLP cap. 6. Las diferencias son tres: allí se encoge un vector de coeficientes en vez de un número; el \mu verdadero no se conoce, así que c^{*} no se puede calcular y se busca por validación cruzada; y el encogimiento se aplica con más razón cuanto menos datos hay, que es exactamente lo que dice c^{*} = \mu^2/(\mu^2 + \sigma^2/n) al crecer n. La estructura del argumento es la misma que la de esta tabla.
Ejercicios
Ejercicio 1 — Descomposición del ECM
Verificar la Proposición 7.5 numéricamente. Devolver la diferencia absoluta entre el ECM directo y la suma de sesgo² más varianza.
El sesgo es la media del estimador menos el valor verdadero: est.mean() - MU. La varianza es la del propio estimador sobre las repeticiones: est.var().
Ejercicio 2 — Insesgado pero no consistente
Comprobar que usar solo el primer dato es insesgado y no consistente. Devolver el ECM con n = 400.
El primer dato de cada muestra es la primera columna de la matriz: X[:, 0].
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 07:
- Escribir
evaluar(estimador, generador, theta, n, reps)que devuelva sesgo, varianza y ECM de cualquier estimador. Usarla para comparar media, mediana, media recortada al 10 % y semisuma de extremos, sobre población normal, exponencial y de cola pesada. Presentar una tabla de 4 estimadores × 3 poblaciones y decidir cuál usar en cada caso. - Encontrar el c óptimo del estimador encogido de forma analítica. Con \hat{\theta} = c\bar{x} y \mu verdadera, escribir el ECM como función de c, derivar respecto a c, igualar a cero y despejar. Comparar la fórmula obtenida con el óptimo numérico del apartado 5.
- Construir un estimador sesgado y consistente cuyo ECM sea menor que el de \bar{x} para n pequeño y mayor para n grande. Graficar los dos ECM contra n y localizar el punto de cruce.
Del libro
Think Stats se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.
The standard deviation of a sampling distribution, which quantifies the variability of an estimate due to random sampling.
Downey, Think Stats 3e, §8.8 Glossary, definición de standard error
Es la Definición 1.7 vista desde aquí: el error estándar es la raíz de la varianza que aparece en la Proposición 7.5, es decir, una de las dos mitades del ECM. La otra mitad, el sesgo, no la captura.
Preguntas para leer §8 con lápiz:
- §8.2 se titula Robustness. ¿Qué estimadores llama robustos y contra qué tipo de contaminación de los datos lo son? Relacionarlo con lo que ocurre al elegir la población de cola pesada en el visual.
- §8.3 Estimating Variance compara los denominadores n y n-1. ¿Cuál de los dos tiene menor ECM, y por qué eso no contradice la Proposición 7.3?
- §8.7 Sources of Error enumera fuentes de error que no son el muestreo aleatorio. ¿Cuáles menciona, y cuáles de ellas no se reducen aumentando n?
Para el Cerebro
Nota nueva en 10-Conceptos/estimacion.md, enlazada a [[poblacion-muestra]], [[esperanza-varianza]] y [[teorema-central-limite]]. La Proposición 7.5 conviene escribirla a mano: reaparece en el módulo de aprendizaje automático como descomposición del error de predicción.
¿Qué es un estimador?::Una función de la muestra usada para aproximar un parámetro de la población
¿Qué significa que un estimador sea insesgado?::Que su esperanza coincide con el parámetro: E[θ̂] = θ, para cada n
¿Insesgado significa que acierta?::No: casi nunca acierta. Significa que el promedio sobre todas las muestras posibles cae sobre el valor verdadero
¿Es s insesgado para σ?::No. s² lo es para σ², pero la raíz cuadrada rompe la insesgadez y s subestima
¿Qué es el error cuadrático medio?::E[(θ̂ − θ)²]: lo que el estimador se equivoca en promedio, al cuadrado
¿Cómo se descompone el ECM?::En sesgo al cuadrado más varianza
¿Por qué se anula el término cruzado en esa demostración?::Porque E[θ̂ − E[θ̂]] = 0 y el otro factor es una constante
¿Puede un estimador sesgado ser mejor que uno insesgado?::Sí: si el sesgo que introduce reduce la varianza más de lo que él mismo aporta al ECM
¿Qué es la consistencia?::Que el estimador converja en probabilidad al parámetro cuando n crece
¿Basta con que el ECM tienda a cero para tener consistencia?::Sí, por la desigualdad de Markov aplicada al cuadrado del error
¿Hay estimadores insesgados y no consistentes?::Sí: usar solo el primer dato de la muestra. Su esperanza es μ y su varianza se queda en σ² para siempre
¿Dónde reaparece la descomposición sesgo-varianza?::En el error de predicción de cualquier modelo, y es el argumento que justifica la regularización
Fuentes
Lo que esta página demuestra sola. La identidad de la Proposición 7.5 se comprueba a cero absoluto en el navegador; el ECM del estimador encogido y el del primer dato se calculan al abrir la página. Las Proposiciones 7.3, 7.5 y 7.7 se demuestran paso a paso a partir de resultados de las lecciones 4 y 6.
Lo que viene de los libros.
- Think Stats 3e (Downey, CC BY-NC-SA 4.0), §8 Estimation — citado textualmente arriba.
Lo que es mío, no del libro. La numeración de definiciones y proposiciones. La demostración de la Proposición 7.3 parte (3) —que s subestima a \sigma— y la de la Proposición 7.7 vía la desigualdad de Markov están escritas aquí; Think Stats no las da. La tabla de los cuatro casos de insesgadez y consistencia, y el estimador encogido como puente hacia la regularización, son forma de presentarlo.
Índices verificados el 12-09-2026 contra el índice publicado del libro.
→ Siguiente: Máxima verosimilitud