Aprendizaje estadístico: sesgo, varianza y error
Machine Learning · Lección 1
Objetivo
Al terminar esta lección se puede:
- Enunciar qué problema resuelve el aprendizaje estadístico y qué parte del error no se puede bajar por buen que sea el método.
- Demostrar la descomposición del error esperado en sesgo al cuadrado, varianza y error irreducible, y medir los tres términos por separado.
- Explicar por qué un modelo más flexible baja el sesgo y sube la varianza, y por qué el error total tiene forma de U.
- Demostrar que el error de entrenamiento subestima al de prueba en una cantidad que se puede calcular, y que crece con el número de parámetros.
- Reconocer el sobreajuste por lo que es: un error de entrenamiento que baja mientras el de prueba sube.
De dónde viene
- Estadística 7: la definición de sesgo y de varianza de un estimador, y el compromiso entre ambos. Esta lección es ese compromiso aplicado a una predicción en lugar de a un parámetro.
- Estadística 13: la regresión por mínimos cuadrados, que es el modelo sobre el que se miden las dos cantidades.
- Estadística 17: mirar los datos muchas veces infla el error de tipo I. Aquí reaparece como el error de entrenamiento que se mira a sí mismo.
- Álgebra 6: la proyección que resuelve los mínimos cuadrados, y su número de condición.
Para qué sirve después
- ML 4: la validación cruzada existe para estimar el error de prueba sin tener un conjunto de prueba, y su razón de ser es la Proposición 1.5 de esta página.
- ML 5: la regularización acepta un poco de sesgo a cambio de mucha varianza menos, que es la Proposición 1.3 usada como herramienta de diseño.
- ML 8: el bagging baja varianza sin tocar el sesgo, y el boosting hace lo contrario.
- Estadística 16: el Brier se descompone igual que el error cuadrático, en piezas que se leen por separado.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| f | efe | La relación verdadera entre las variables, desconocida |
| \hat{f} | efe sombrero | Lo que el método estima a partir de los datos |
| \varepsilon | épsilon | El ruido: lo que X no puede explicar de Y |
| \sigma^2 | sigma cuadrado | La varianza del ruido, el error irreducible |
| x_0 | equis sub cero | Un punto concreto donde se evalúa el error |
| n | ene | El tamaño de la muestra de entrenamiento |
| p | pe | El número de parámetros que el modelo ajusta |
1. El problema y su suelo
Definición 1.1 (el modelo del aprendizaje supervisado). Se supone que existe una función f desconocida y que cada observación cumple Y = f(X) + \varepsilon, con \varepsilon independiente de X, de media cero y varianza \sigma^2. A partir de una muestra se construye una estimación \hat{f}, y el objetivo es que \hat{f}(x_0) prediga bien el valor de Y en un punto x_0 que no se usó para construirla.
El término \varepsilon recoge todo lo que X no puede explicar: variables no medidas, error de medición, azar genuino.
Proposición 1.2 (hay un suelo que ningún método baja). Sea \hat{f} cualquier estimación construida con datos independientes de la observación nueva, y sea Y_0=f(x_0)+\varepsilon_0 esa observación. Entonces E\big[(Y_0-\hat{f}(x_0))^2\big] \;\ge\; \sigma^2, con igualdad únicamente si \hat{f}(x_0)=f(x_0) con probabilidad uno.
Demostración. Escríbase la diferencia separando el ruido nuevo: Y_0-\hat{f}(x_0) = \big(f(x_0)-\hat{f}(x_0)\big) + \varepsilon_0 . Al elevar al cuadrado y tomar esperanza aparece un doble producto, y ese doble producto se anula: \varepsilon_0 tiene media cero y es independiente de \hat{f}(x_0), que se construyó con otros datos. Queda E\big[(Y_0-\hat{f}(x_0))^2\big] = E\big[(f(x_0)-\hat{f}(x_0))^2\big] + \sigma^2 . El primer sumando es la esperanza de un cuadrado, luego no es negativo, y se anula solo si \hat{f}(x_0)=f(x_0) casi seguramente. ∎
Ese \sigma^2 es el error irreducible, y conviene tenerlo presente desde el principio: un modelo que alcanzara la verdad exacta seguiría equivocándose en esa cantidad. Comparar el error de un método contra cero es comparar contra un objetivo imposible; lo que se compara es contra \sigma^2.
2. La descomposición
Proposición 1.3 (sesgo, varianza y ruido). Con las hipótesis de la Definición 1.1, E\big[(Y_0-\hat{f}(x_0))^2\big] \;=\; \underbrace{\big(E[\hat{f}(x_0)]-f(x_0)\big)^2}_{\text{sesgo}^2} \;+\; \underbrace{\operatorname{Var}\big(\hat{f}(x_0)\big)}_{\text{varianza}} \;+\; \underbrace{\sigma^2}_{\text{irreducible}}, donde la esperanza y la varianza se toman sobre las muestras de entrenamiento posibles.
Demostración. Por la demostración de la Proposición 1.2, basta descomponer E[(f(x_0)-\hat{f}(x_0))^2]. Escríbase \mu=E[\hat{f}(x_0)] y súmese y réstese: f(x_0)-\hat{f}(x_0) = \big(f(x_0)-\mu\big) + \big(\mu-\hat{f}(x_0)\big). Al elevar al cuadrado y tomar esperanza, el primer término es una constante y da (f(x_0)-\mu)^2; el segundo da E[(\hat{f}(x_0)-\mu)^2]=\operatorname{Var}(\hat{f}(x_0)); y el doble producto se anula porque E[\mu-\hat{f}(x_0)]=0 y el otro factor es constante. Sumando el \sigma^2 de la Proposición 1.2 se obtiene el enunciado. ∎
La varianza mide la consistencia de la predicción en un punto dado cuando el modelo se reentrena varias veces, por ejemplo sobre distintos subconjuntos de los datos de entrenamiento. Un modelo flexible se ajusta a cada muestra concreta, de modo que es sensible a la aleatoriedad de la que le tocó. El sesgo, en cambio, mide cuánto se apartan esas predicciones del valor correcto en general, también al reconstruir el modelo sobre muestras distintas: es el error sistemático, el que no procede del azar, y un modelo demasiado rígido para la forma de f lo arrastra por muchos datos que reciba. El ruido no depende del modelo y permanece con cualquiera.
La celda mide los tres términos por separado sorteando dos mil muestras de entrenamiento y ajustando en cada una un polinomio, para nueve grados distintos.
La suma de los tres términos reproduce el error medido en los nueve grados, de modo que la Proposición 1.3 se sostiene en los nueve. Los decimales no coinciden del todo porque ambas columnas son estimaciones Monte Carlo con dos mil réplicas. Por eso las afirmaciones de esta página declaran esa discrepancia como propiedad y no fijan un dígito.
El sesgo al cuadrado cae de 0{,}305 en el grado 1 hasta anularse a partir del grado 5, mientras la varianza sube de 0{,}003 a 0{,}020. El total, que es la suma de ambos más el ruido, baja primero y sube después. Ese es el compromiso que da nombre a la lección.
La curva de la derecha nunca baja de la línea discontinua, que es \sigma^2. Esa línea es la Proposición 1.2 dibujada, y explica por qué el mínimo de la U está donde está: a partir del grado 5 el sesgo ya es cero y lo único que puede hacer el error es subir.
3. Por qué el error de entrenamiento engaña
Definición 1.4 (error de entrenamiento y error de prueba). El error de entrenamiento es el error medio sobre las mismas observaciones que se usaron para construir \hat{f}. El error de prueba es el error medio sobre observaciones nuevas, no usadas en la construcción.
Proposición 1.5 (el error de entrenamiento subestima, y se sabe cuánto). Sea un modelo lineal con p parámetros ajustado por mínimos cuadrados sobre n observaciones con ruido de varianza \sigma^2. Entonces E[\text{MSE}_{\text{entrena}}] = \sigma^2\frac{n-p}{n}, \qquad E[\text{MSE}_{\text{prueba}}] = \sigma^2\frac{n+p}{n}, de modo que la brecha entre ambos vale exactamente 2\sigma^2 p/n y crece con el número de parámetros.
Demostración. El ajuste por mínimos cuadrados proyecta y sobre el subespacio generado por las p columnas (lección de Álgebra 6), y el residuo es la proyección sobre el complemento ortogonal, de dimensión n-p. La esperanza de la suma de cuadrados residual es entonces \sigma^2(n-p), y dividiendo por n se obtiene la primera fórmula.
Para la segunda, evalúese el ajuste sobre observaciones nuevas en los mismos puntos. El error en cada punto es el ruido nuevo más la desviación del ajuste, que son independientes; la esperanza del cuadrado es \sigma^2 más la varianza del ajuste en ese punto. Sumando sobre los n puntos, la varianza total del ajuste es \sigma^2 p, porque la proyección vive en un subespacio de dimensión p. Queda \sigma^2 n + \sigma^2 p, y dividiendo por n sale la segunda fórmula.
Restando, la brecha es 2\sigma^2p/n. ∎
La celda mide las dos cantidades en el caso más desfavorable imaginable: cuando la verdad es que ningún predictor sirve. Así, todo el ajuste que el modelo consiga es ruido memorizado.
Las tres parejas de columnas cuadran con la teoría. Lo que hay que mirar es la dirección: al pasar de 2 a 15 parámetros el error de entrenamiento baja de 0{,}96 a 0{,}75, y el de prueba sube de 1{,}03 a 1{,}25. Y la verdad de este experimento es que no hay nada que aprender.
Un error de entrenamiento que mejora no dice nada por sí solo, porque mejora incluso cuando el modelo está aprendiendo ruido. La única cifra que informa sobre la capacidad de predecir es la medida sobre datos que el modelo no vio.
Definición 1.6 (sobreajuste). Un modelo sobreajusta cuando, al aumentar su flexibilidad, su error de entrenamiento sigue bajando mientras el de prueba sube. Por la Proposición 1.3, eso ocurre cuando el aumento de varianza supera a la reducción de sesgo.
Las dos curvas salen de las fórmulas exactas de la Proposición 1.5 y no de una simulación. Cambiar el tamaño de la muestra mueve las dos a la vez, porque la brecha vale 2p/n: con más datos caben más parámetros por la misma penalización. De ahí viene la costumbre de exigir muchas más observaciones que variables, que suele enunciarse como una proporción fija sin decir de dónde sale.
Ejercicios
Ejercicio 1, Dónde está el mínimo
Localizar el grado que minimiza el error total, usando la descomposición en lugar del error medido.
Por la Proposición 1.3 el total es la suma de los tres términos, y el ruido es el mismo para todos. np.argmin devuelve la posición del mínimo, empezando en cero; los grados empiezan en uno.
Ejercicio 2, Cuántos parámetros caben
Calcular cuántos parámetros se pueden permitir para que la brecha entre entrenamiento y prueba no supere 0{,}1\,\sigma^2, con n = 500.
Por la Proposición 1.5 la brecha vale 2p/n en unidades de \sigma^2. Despejar p y quedarse con la parte entera.
Reto
En proyectos/notebooks/F2-retos.ipynb, sección ML 1:
- Repetir la medición de la Proposición 1.3 en varios puntos x_0 a la vez y comprobar que el grado que minimiza el error depende del punto: en el interior del rango gana un grado más alto que en los extremos. Relacionarlo con la varianza de un polinomio cerca de los bordes.
- Comprobar la Proposición 1.5 con un modelo cuya verdad no sea nula, y verificar que las fórmulas siguen valiendo: el sesgo del modelo correcto no altera la brecha, que sigue siendo 2\sigma^2p/n. Anotar en
50-Errores/por qué eso es sorprendente a primera vista. - Medir qué le pasa a la descomposición cuando n crece con el grado fijo. Comprobar que la varianza baja como 1/n y el sesgo no se mueve, y deducir qué parte del error se arregla con más datos y cuál no.
Del libro
An Introduction to Statistical Learning with Applications in Python trata este material en §2.2 Assessing Model Accuracy, dentro de su capítulo 2 Statistical Learning. El compromiso entre sesgo y varianza tiene sección propia, §2.2.2 The Bias-Variance Trade-Off, y el libro lo retoma más adelante en §5.1.4 Bias-Variance Trade-Off for k-Fold Cross-Validation, que corresponde a la lección 4 de este módulo. El libro es de acceso libre; aquí se cita número y título y no se transcribe texto.
Preguntas para leer §2.2 con lápiz:
- §2.2.2 presenta la descomposición del error esperado en sus tres piezas. Con la Proposición 1.3, ¿por qué el término del ruido aparece sumado y no multiplicado, y qué hipótesis de la Definición 1.1 es la que lo permite?
- §2.2 muestra la curva del error de prueba con su forma de U y la del error de entrenamiento bajando siempre. Con la Proposición 1.5, ¿por qué la segunda no tiene mínimo, y qué habría que penalizarle para que lo tuviera?
- La sección distingue el error de entrenamiento del de prueba. Con la Definición 1.4 y la 1.6, ¿por qué un modelo que interpola exactamente los datos tiene error de entrenamiento cero y sin embargo puede ser el peor de todos?
Para el Cerebro
Nota nueva en 10-Conceptos/sesgo-varianza.md, enlazada a [[estimacion]] y a [[sintesis-estadistica]]. Conviene rehacer a mano la demostración de la Proposición 1.3: son dos veces el mismo truco, sumar y restar una cantidad para que el doble producto se anule, y reconocerlo hace que la descomposición deje de parecer una fórmula que memorizar.
¿Qué supone el modelo del aprendizaje supervisado?::Y = f(X) + ε, con ε de media cero, varianza σ² e independiente de X
¿Qué es el error irreducible?::σ², la varianza del ruido. Ningún método baja de ahí, ni siquiera el que acierte f exactamente
¿Cuáles son las tres piezas del error esperado?::Sesgo al cuadrado, varianza del estimador, y el ruido σ²
¿Sobre qué se toman la esperanza y la varianza?::Sobre las muestras de entrenamiento posibles, no sobre los puntos
¿Qué mide el sesgo?::Si el método apunta al sitio correcto en promedio; un modelo rígido no puede, por muchos datos que reciba
¿Qué mide la varianza?::Cuánto se mueve la predicción al cambiar la muestra; un modelo flexible se mueve mucho
¿Por qué el error total tiene forma de U?::Al ganar flexibilidad el sesgo cae y la varianza sube; el mínimo está donde se cruzan las pendientes
¿Cuánto vale el error de entrenamiento esperado?::σ²(n−p)/n: BAJA al añadir parámetros, aunque sean inútiles
¿Y el de prueba?::σ²(n+p)/n: SUBE en la misma cantidad
¿Cuánto vale la brecha?::2σ²p/n, y por eso más datos permiten más parámetros
¿Qué es sobreajustar?::Que el error de entrenamiento baje mientras el de prueba sube
¿Por qué no basta con mirar el error de entrenamiento?::Mejora incluso cuando el modelo solo memoriza ruido; con β = 0 baja de 0.96 a 0.75
Fuentes
Lo que esta página demuestra sola. Las Proposiciones 1.2, 1.3 y 1.5 se demuestran aquí a partir de la Definición 1.1 y de la geometría de la proyección de Álgebra 6, y las tres se comprueban ejecutándolas: que la suma de sesgo al cuadrado, varianza y ruido reproduce el error medido en los nueve grados, dentro del error de simulación de dos mil réplicas; que el sesgo cae de 0{,}305 a cero mientras la varianza sube de 0{,}003 a 0{,}020, con el mínimo del total en el grado 6; y que con \beta=0, es decir sin nada que aprender, el error de entrenamiento baja de 0{,}96 a 0{,}75 al pasar de 2 a 15 parámetros mientras el de prueba sube de 1{,}03 a 1{,}25, cuadrando las seis cifras con \sigma^2(n\mp p)/n. Los dos visuales usan esas mismas cantidades: el primero las medidas por la celda, el segundo las fórmulas exactas.
Lo que se usa de otras lecciones sin repetir. La definición de sesgo y varianza de un estimador es de Estadística 7. Que los mínimos cuadrados proyectan sobre el espacio columna, y que el residuo vive en el complemento ortogonal de dimensión n-p, es de Álgebra 6. La regresión lineal es de Estadística 13.
Lo que se enuncia sin demostrar. Que la esperanza de la suma de cuadrados residual de una proyección vale \sigma^2 por la dimensión del complemento: se usa en la Proposición 1.5 apelando a la geometría, sin desarrollar el argumento con la distribución de formas cuadráticas, que Estadística 14 declara en sus propias Fuentes. Las discrepancias entre la suma de los tres términos y el error medido son error de Monte Carlo y no se cuantifican con un intervalo.
Lo que viene de los libros.
- An Introduction to Statistical Learning with Applications in Python (James, Witten, Hastie, Tibshirani & Taylor, Springer, 2023), §2.2 Assessing Model Accuracy y §2.2.2 The Bias-Variance Trade-Off — citadas por número y título, sin transcribir texto.
Lo que es mío, no del libro. La elección de medir los tres términos por separado en vez de dibujar solo la curva del error, que es lo que convierte la descomposición en algo observable. La Proposición 1.5 con sus dos fórmulas cerradas y la brecha 2\sigma^2p/n explícita, en lugar del enunciado cualitativo habitual. Y el experimento con \beta=0: no es un caso extremo escogido para asustar sino el único en que la conclusión es inequívoca, porque cualquier mejora del error de entrenamiento es, con certeza, ruido memorizado.
Índice de ISLP verificado el 13-09-2026 contra los marcadores del PDF oficial, con sus tres niveles.