Teorema central del límite

Estadística · Lección 6

L2 Derivación Fase F1 Libro Think Stats 3e §14 Prereqs Esperanza y varianza · Distribuciones analíticas

Objetivo

Al terminar esta lección se puede:

  1. Enunciar el teorema central del límite con precisión, incluidas sus hipótesis.
  2. Derivar la media y la varianza de una suma de n variables, que es la mitad del enunciado.
  3. Reconocer los tres casos en que el teorema no se aplica y explicar qué falla en cada uno.
  4. Usar el teorema para construir un intervalo aproximado alrededor de una media muestral.

De dónde viene

  • Lección 1: la distribución muestral de \bar{x} se dibujó ahí por simulación. Esta lección dice cuál es su forma.
  • Lección 1: la ley \sigma/\sqrt{n} (Definición 1.7) se enunció sin demostrar; aquí se demuestra.
  • Lección 3: la normal se presentó como familia sin justificar por qué aparece tanto. Esta lección es esa justificación.
  • Lección 4: las Proposiciones 4.4, 4.6 y 4.8 —linealidad de la esperanza, escala de la varianza y varianza de una suma— son las herramientas de la demostración.

Para qué sirve después

  • Lección 7: la distribución muestral normal es lo que permite hablar de la precisión de un estimador.
  • Lección 9: un intervalo de confianza al 95 % usa el 1.96 que sale de la normal.
  • Lección 10: casi toda prueba de hipótesis clásica compara un estadístico contra una normal.
  • Lección 11: el bootstrap existe precisamente para los casos en que este teorema no se aplica o n es pequeño.
  • Matemática 6 e ISLP cap. 3: los errores estándar de los coeficientes de regresión se justifican con este teorema.

Notación

Símbolo Se lee Significado
X_1, \dots, X_n equis sub uno a equis sub ene n variables independientes con la misma distribución
S_n ese sub ene Su suma, \sum_{i=1}^{n} X_i
\bar{X}_n equis barra sub ene Su media, S_n/n
\mu, \sigma^2 mu, sigma cuadrado Media y varianza de cada X_i, supuestas finitas
Z_n zeta sub ene La suma estandarizada
\xrightarrow{d} converge en distribución La acumulada tiende a la acumulada del límite, en cada punto
i.i.d. independientes e idénticamente distribuidas Las dos hipótesis del teorema

La abreviatura i.i.d. aparecerá constantemente. Reúne dos condiciones distintas: independientes —el valor de una no informa sobre las otras— e idénticamente distribuidas —todas salen de la misma distribución—. El teorema necesita las dos.

1. La mitad fácil: media y varianza de una suma

Antes del teorema, dos resultados que salen directamente de la lección 4 y que ya contienen la ley de la raíz de n.

Proposición 6.1. Sean X_1, \dots, X_n i.i.d. con media \mu y varianza \sigma^2 finitas. Entonces: E[S_n] = n\mu, \qquad \text{Var}(S_n) = n\sigma^2, \qquad E[\bar{X}_n] = \mu, \qquad \text{Var}(\bar{X}_n) = \frac{\sigma^2}{n}.

Demostración. Para la suma, la linealidad de la esperanza (Proposición 4.4) se aplica n veces sin necesidad de independencia: E[S_n] = E\Big[\sum_i X_i\Big] = \sum_i E[X_i] = n\mu.

Para la varianza sí hace falta la independencia. La Proposición 4.8 dice que \text{Var}(X+Y) incluye un término cruzado 2\,\text{Cov}(X,Y), y por la Proposición 5.8 ese término se anula cuando las variables son independientes. Aplicándolo repetidamente: \text{Var}(S_n) = \sum_i \text{Var}(X_i) = n\sigma^2.

Para la media, \bar{X}_n = \frac{1}{n}S_n es la suma multiplicada por la constante 1/n. Por la Proposición 4.4, E[\bar{X}_n] = \frac{1}{n}\cdot n\mu = \mu. Por la Proposición 4.6, la constante entra al cuadrado en la varianza: \text{Var}(\bar{X}_n) = \frac{1}{n^2}\,\text{Var}(S_n) = \frac{1}{n^2}\cdot n\sigma^2 = \frac{\sigma^2}{n}. \;

Tomando raíz cuadrada en la última igualdad se obtiene \text{sd}(\bar{X}_n) = \sigma/\sqrt{n}, que es exactamente la Definición 1.7. Aquella fórmula queda ahora demostrada, y se ve de dónde viene el n^2 del denominador: de que la varianza escala con el cuadrado de la constante.

Nótese lo que esta proposición no dice: nada sobre la forma de la distribución de S_n. Solo fija dónde está centrada y cuánto se dispersa. La forma es el contenido del teorema.

2. El teorema

Definición 6.2 (suma estandarizada). Con la notación anterior, Z_n = \frac{S_n - n\mu}{\sigma\sqrt{n}} = \frac{\bar{X}_n - \mu}{\sigma/\sqrt{n}}.

Las dos expresiones son la misma: dividir numerador y denominador entre n convierte una en la otra. Por la Proposición 6.1, Z_n tiene media 0 y varianza 1 para todo n; estandarizar elimina la posición y la escala, y deja solo la forma.

Teorema 6.3 (central del límite). Sean X_1, X_2, \dots independientes e idénticamente distribuidas, con media \mu y varianza \sigma^2 finitas. Entonces Z_n \xrightarrow{d} \mathcal{N}(0,1) \qquad \text{cuando } n \to \infty, es decir, P(Z_n \le z) \to \Phi(z) para todo z.

La demostración completa usa funciones características y queda fuera del alcance de esta lección; la lección 14 la retoma. Lo que sí se puede entender ahora es por qué la distribución de partida deja de importar.

La estandarización fija la media en 0 y la varianza en 1, así que los dos primeros momentos ya no distinguen nada. Los momentos de orden superior —la asimetría y la curtosis de la lección 4— sí distinguen, pero al sumar n copias independientes se diluyen: la asimetría de Z_n resulta ser la de X dividida entre \sqrt{n}, y la curtosis en exceso, la de X dividida entre n. Ambas tienden a cero, que son los valores de la normal.

El teorema no dice que la naturaleza prefiera la normal. Dice que sumar borra la información de forma.

El visual siguiente suma copias de la distribución que se elija y estandariza el resultado.

Distribución de partida:

Recorriendo las cuatro distribuciones con n = 30, la distancia a la normal queda así:

Distribución de partida Asimetría Distancia a la normal con n = 30
Uniforme 0.00 0.008
Exponencial 2.00 0.019
Lognormal(0, 0.9) 4.75 0.047
Dos valores, p = 0.15 1.96 0.121

La uniforme ya había convergido con 5 sumandos. La exponencial, con la misma n, sigue a más del doble de distancia. La velocidad depende de la asimetría de partida, que es lo que la última columna ordena casi perfectamente.

Casi, porque la última fila rompe el orden: con asimetría 1.96, menor que la de la exponencial, queda seis veces peor. La razón es que esa distribución es discreta: la suma de n copias solo puede tomar n+1 valores distintos, así que su acumulada es una escalera y no puede pegarse a una curva continua por muchos sumandos que se añadan. La convergencia ocurre igual, pero más despacio y con escalones visibles.

De ahí que la regla habitual de «con n \ge 30 ya vale» no tenga fundamento general: depende de la asimetría y de si la variable es discreta. El reto 2 pide encontrar el n mínimo para cada caso.

3. Dónde no se aplica

The values have to be drawn from a distribution with finite mean and variance. So the CLT doesn’t apply to some long-tailed distributions.

Downey, Think Stats 3e, §14.6 The Limits of the Central Limit Theorem

El Teorema 6.3 tiene tres hipótesis, y cada una puede fallar por separado.

Hipótesis Qué pasa si falla Ejemplo
Varianza finita No hay convergencia a la normal Cauchy; Pareto con \alpha \le 2
Independencia La varianza de la suma no es n\sigma^2 Series temporales, datos por conglomerados
Misma distribución Puede seguir valiendo, pero con condiciones extra Suma de efectos de tamaños muy dispares

El primer caso es el más instructivo porque falla de forma espectacular. La distribución de Cauchy tiene una propiedad notable: la media de n observaciones de una Cauchy es de nuevo una Cauchy, con la misma dispersión. Promediar mil valores no reduce nada.

La columna de la normal baja como 1/\sqrt{n}, según la Proposición 6.1. La de la Cauchy no baja: promediar mil observaciones deja la misma incertidumbre que tomar una sola. La razón es que la Cauchy no tiene media ni varianza finitas, así que la Proposición 6.1 no llega siquiera a enunciarse, y sin ella no hay teorema.

Warning

Este caso no es una curiosidad de laboratorio. Cualquier magnitud con cola de tipo Pareto y \alpha \le 2 —distribuciones de riqueza, tamaños de archivo, algunas medidas de tráfico— cae aquí. Con esos datos, el promedio de una muestra grande puede seguir siendo muy inestable, y reportarlo con un error estándar es engañoso.

4. Para qué sirve

Si n es suficientemente grande, el Teorema 6.3 permite escribir

\bar{X}_n \;\approx\; \mathcal{N}\!\left(\mu,\; \frac{\sigma^2}{n}\right),

y de ahí, como el 95 % de una normal estándar cae entre -1.96 y 1.96:

P\!\left(\mu - 1.96\,\frac{\sigma}{\sqrt{n}} \;\le\; \bar{X}_n \;\le\; \mu + 1.96\,\frac{\sigma}{\sqrt{n}}\right) \approx 0.95.

Reordenando esa desigualdad se obtiene el intervalo de confianza de la lección 10. Aquí conviene fijarse en dos detalles: el símbolo es \approx y no =, y el grado de aproximación depende de n y de la asimetría de la distribución de partida, como mostró el visual.

Con la uniforme, la cobertura real está prácticamente en el 95 % prometido. Con la exponencial se queda algo por debajo. Con la lognormal de cola gruesa, bastante por debajo: el intervalo promete más de lo que cumple. Ese déficit es el precio de usar una aproximación con n insuficiente para la asimetría que se tiene.

Ejercicios

Ejercicio 1 — Estandarizar una suma

Implementar la Definición 6.2: dada una matriz con una muestra por fila, devolver las sumas estandarizadas.

La Definición 6.2 dice Z_n = \dfrac{S_n - n\mu}{\sigma\sqrt{n}}. Traducido: (S - n*mu) / (sigma * np.sqrt(n)).

Ejercicio 2 — La Cauchy no obedece

Comprobar que promediar observaciones de una Cauchy no reduce su dispersión. Devolver el cociente entre el rango intercuartílico con n = 1000 y el de n = 1.

Igual que una, pero con 1000 columnas en lugar de 1: rng.standard_cauchy(size=(reps, 1000)).mean(axis=1).

Reto

En proyectos/notebooks/F1-retos.ipynb, sección Est 06:

  1. Medir la velocidad de convergencia. Para cada distribución de partida —uniforme, exponencial, lognormal con varios \sigma, y una mezcla asimétrica—, calcular la distancia máxima entre la acumulada de Z_n y la normal para n = 1, 2, 5, 10, \dots, 200. Graficar esa distancia contra n en ejes log-log y relacionar la pendiente con la asimetría de partida.
  2. Determinar el n mínimo para que un intervalo al 95 % tenga cobertura real de al menos el 94 %, para cada una de esas distribuciones. Comparar los resultados con la regla habitual de n \ge 30 y escribir en qué casos esa regla falla.
  3. Romper la independencia. Generar una serie donde cada valor dependa del anterior con coeficiente \phi, y medir la varianza real de \bar{X}_n frente a la \sigma^2/n que predice la Proposición 6.1, para \phi = 0,\ 0.3,\ 0.6,\ 0.9. Cuantificar cuánto se subestima el error estándar al ignorar la dependencia.

Del libro

Think Stats se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.

If we generate n values and add them up, the distribution of the sum converges to normal as n increases. More specifically, if the distribution of the values has mean m and variance s2 the distribution of the sum converges to a normal distribution with mean n * m and variance n * s2.

Downey, Think Stats 3e, §14.5 Central Limit Theorem

Es el Teorema 6.3 enunciado sobre la suma en lugar de sobre la suma estandarizada. Las dos formas son equivalentes: la media n\mu y la varianza n\sigma^2 que menciona Downey son exactamente las de la Proposición 6.1, y estandarizar con ellas es lo que produce la Definición 6.2.

some Pareto distributions do not have finite mean and variance – in those cases, the Central Limit Theorem does not apply

Downey, Think Stats 3e, §14.6 The Limits of the Central Limit Theorem

La Pareto de la Definición 3.11 tiene varianza finita solo si \alpha > 2, y media finita solo si \alpha > 1. El apartado 3 desarrolla este caso con la Cauchy, que falla por el mismo motivo de forma aún más extrema.

Preguntas para leer §14 con lápiz:

  1. §14.3 se titula Distribution of Sample Means y §14.4 Distribution of Differences. ¿Qué distribución tiene la diferencia de dos medias muestrales independientes, y cómo se combinan sus varianzas?
  2. §14.1 usa normal probability plots, que aquí aparecen como Proposición 3.7. ¿Cómo los emplea Downey para juzgar si la convergencia del teorema ya se ha producido?
  3. §14.7 Applying the CLT y §14.9 Chi-squared Test. ¿Qué prueba concreta construye con el teorema, y qué hipótesis tendría que comprobar antes de usarla?

Para el Cerebro

Nota nueva en 10-Conceptos/teorema-central-limite.md, enlazada a [[poblacion-muestra]], [[esperanza-varianza]] y [[distribuciones-analiticas]]. En 50-Errores/, anotar que la regla de n \ge 30 no tiene fundamento general y que la velocidad depende de la asimetría.

¿Qué dice el teorema central del límite?::Que la suma estandarizada de n variables i.i.d. con media y varianza finitas converge en distribución a una normal estándar
¿Qué significa i.i.d.?::Independientes e idénticamente distribuidas: son dos condiciones distintas y el teorema necesita las dos
¿Cuál es la media y la varianza de una suma de n i.i.d.?::nμ y nσ²
¿Cuál es la varianza de la media muestral?::σ²/n, porque la constante 1/n entra al cuadrado
¿Por qué la distribución de partida deja de importar?::Porque estandarizar fija los dos primeros momentos, y los de orden superior se diluyen al sumar
¿Cómo se diluye la asimetría al sumar n copias?::Se divide entre √n; la curtosis en exceso, entre n
¿De qué depende la velocidad de convergencia?::De la asimetría de la distribución de partida
¿Es válida la regla de n ≥ 30?::No en general: con una uniforme bastan 3 y con una lognormal de cola gruesa no bastan 200
¿Cuáles son las tres hipótesis del teorema?::Varianza finita, independencia e idéntica distribución
¿Qué pasa al promediar observaciones de una Cauchy?::Nada: la media de n Cauchy es otra Cauchy con la misma dispersión
¿Por qué falla el teorema con la Cauchy?::Porque no tiene media ni varianza finitas, así que la Proposición 6.1 ni siquiera se puede enunciar
¿Cuándo tiene varianza finita una Pareto?::Solo si α > 2; la media es finita solo si α > 1

Fuentes

Lo que esta página demuestra sola. La convergencia del histograma estandarizado a la normal, la distancia máxima entre acumuladas, la no convergencia de la media de una Cauchy y la cobertura real de un intervalo al 95 % se calculan en el navegador al abrir la página. La Proposición 6.1 se demuestra paso a paso a partir de las Proposiciones 4.4, 4.6, 4.8 y 5.8.

Lo que viene de los libros.

  • Think Stats 3e (Downey, CC BY-NC-SA 4.0), §14 Analytic Methods, en particular §14.5 y §14.6 — citado textualmente arriba.

Lo que es mío, no del libro. La demostración del Teorema 6.3 no se da aquí: requiere funciones características y se pospone a la lección 14. Lo que sí se argumenta —que estandarizar fija los dos primeros momentos y que los de orden superior se diluyen como potencias de 1/\sqrt{n}— es una explicación del mecanismo, no una demostración, y está escrita para esta lección. La tabla de las tres hipótesis y el experimento de cobertura del apartado 4 tampoco proceden del libro.

Índices verificados el 12-09-2026 contra el índice publicado del libro.

→ Siguiente: Estimación: sesgo, varianza y consistencia