Intervalos de confianza: lo que prometen y cuándo fallan
Estadística · Lección 9
Objetivo
Al terminar esta lección se puede:
- Definir intervalo de confianza y decir con precisión qué es aleatorio en él y qué no.
- Construir el intervalo para la media con \sigma conocida y demostrar que su cobertura es exactamente la nominal.
- Explicar por qué «hay un 95 % de probabilidad de que \mu esté en este intervalo» no es lo que afirma el método.
- Distinguir cobertura nominal de cobertura real, y medirla en dos casos clásicos donde no coinciden.
De dónde viene
- Lección 1: la distribución muestral de \bar{x} (Definición 1.6) es el objeto que se recorta para formar el intervalo.
- Lección 6: la Proposición 6.1 dio \text{Var}(\bar{x}) = \sigma^2/n, y el teorema central del límite dio la forma normal. Sin esos dos resultados no hay fórmula.
- Lección 7: el intervalo se construye alrededor de un estimador; el error estándar que fija su anchura es la raíz de la varianza de la Proposición 7.5.
Para qué sirve después
- Lección 10: un intervalo de confianza y una prueba de hipótesis son el mismo objeto visto de dos maneras: el intervalo contiene exactamente los valores que la prueba no rechaza.
- Lección 11: el bootstrap construye intervalos sin fórmula, cuando la distribución muestral no se conoce.
- Lección 14: los intervalos para los coeficientes de una regresión son este mismo cálculo, con el error estándar que sale de la matriz de diseño.
- Lección 17: la mayor parte de los errores de interpretación que se catalogan allí son la confusión que ataca la sección 3 de esta lección.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| \alpha | alfa | La proporción de veces que se admite fallar; 1-\alpha es la confianza |
| z_{\alpha/2} | zeta sub alfa medios | El número tal que una normal estándar cae en [-z_{\alpha/2}, z_{\alpha/2}] con probabilidad 1-\alpha |
| \Phi | fi mayúscula | La función acumulada de la normal estándar (Definición 3.6) |
| \text{EE} | error estándar | La desviación típica del estimador, \sigma/\sqrt{n} para \bar{x} |
| T_\nu | te sub nu | Una variable con distribución t de Student de \nu grados de libertad |
| \nu | nu | Grados de libertad; aquí siempre n-1 |
| \hat{p} | pe sombrero | La proporción muestral, k/n |
Una advertencia de lectura antes de empezar. En P(A \le \theta \le B) = 1-\alpha, las letras aleatorias son A y B; \theta es una constante desconocida. La probabilidad se refiere a dónde caen los extremos, no a dónde está \theta. Toda la sección 3 desarrolla esta frase.
1. La definición
Definición 9.1 (intervalo de confianza). Sean A = A(x_1,\dots,x_n) y B = B(x_1,\dots,x_n) dos estadísticos con A \le B. El intervalo aleatorio [A,B] es un intervalo de confianza de nivel 1-\alpha para \theta si P\big(A \le \theta \le B\big) = 1-\alpha para todo valor posible de \theta. A esa probabilidad se la llama cobertura del intervalo.
Dos detalles de la definición conviene no pasarlos por alto. El primero: la igualdad se exige para todo \theta, no para uno. Un procedimiento que acierte el 95 % de las veces cuando \theta = 0 y el 60 % cuando \theta = 7 no es un intervalo de confianza del 95 %. El segundo: nada obliga a que la cobertura real coincida con la que el método anuncia. A la anunciada se la llama nominal, y las secciones 4 y 5 muestran dos casos de uso corriente donde la real queda por debajo.
An interval that contains the most likely values in a sampling distribution.
Downey, Think Stats 3e, §8.8 Glossary, definición de confidence interval
Downey lo construye desde el otro extremo: en §8.6 toma la distribución muestral del estimador y le recorta los percentiles 5 y 95. Es el mismo objeto —la Proposición 9.3 hace exactamente ese recorte con fórmula en vez de con percentiles empíricos— y es el camino que sigue el bootstrap de la lección 11, que no necesita fórmula ninguna. Downey además señala en esa misma sección que la interpretación del intervalo es materia de discusión entre escuelas; la sección 3 se ocupa de qué es lo que sí se puede afirmar sin entrar en esa discusión.
2. El intervalo para la media, con \sigma conocida
Definición 9.2 (cuantil normal). z_{\alpha/2} = \Phi^{-1}\!\big(1-\alpha/2\big), es decir, el punto que deja \alpha/2 de probabilidad en la cola derecha de una normal estándar.
Para los niveles de uso corriente: z_{0.05} = 1.6449 al 90 %, z_{0.025} = 1.9600 al 95 %, z_{0.005} = 2.5758 al 99 %.
Proposición 9.3. Sea x_1,\dots,x_n una muestra de una \mathcal{N}(\mu,\sigma^2) con \sigma conocida. Entonces \Big[\;\bar{x} - z_{\alpha/2}\frac{\sigma}{\sqrt{n}}, \;\; \bar{x} + z_{\alpha/2}\frac{\sigma}{\sqrt{n}}\;\Big] tiene cobertura exactamente 1-\alpha, para todo \mu.
Demostración. Por la Proposición 6.1, E[\bar{x}] = \mu y \text{Var}(\bar{x}) = \sigma^2/n; y por ser combinación lineal de normales independientes, \bar{x} es exactamente normal (no solo aproximadamente: aquí no hace falta el teorema central del límite). Luego la variable estandarizada Z = \frac{\bar{x}-\mu}{\sigma/\sqrt{n}} es \mathcal{N}(0,1). Por la Definición 9.2, P(-z_{\alpha/2} \le Z \le z_{\alpha/2}) = 1-\alpha. Se desarrolla esa desigualdad despejando \mu, multiplicando por \sigma/\sqrt{n} > 0 —que no cambia el sentido— y restando \bar{x}: -z_{\alpha/2} \le \frac{\bar{x}-\mu}{\sigma/\sqrt{n}} \le z_{\alpha/2} \;\Longleftrightarrow\; \bar{x} - z_{\alpha/2}\frac{\sigma}{\sqrt{n}} \le \mu \le \bar{x} + z_{\alpha/2}\frac{\sigma}{\sqrt{n}}. Las dos desigualdades son equivalentes término a término, así que los dos sucesos son el mismo suceso y tienen la misma probabilidad, 1-\alpha. El valor de \mu no interviene en ningún paso, luego la igualdad vale para todo \mu. ∎
Merece la pena mirar qué se ha hecho en esa cadena de equivalencias: se ha reordenado una desigualdad, nada más. Al principio \mu estaba en el centro y los extremos eran fijos; al final los extremos son aleatorios y \mu está fijo en medio. Es el mismo suceso escrito de dos maneras. De ahí sale toda la sutileza de la sección siguiente.
El visual construye cien intervalos sobre cien muestras distintas de la misma población.
3. Lo que el intervalo no dice
Proposición 9.4. Una vez observada la muestra, sean a y b los extremos ya calculados. Entonces P(a \le \mu \le b) \in \{0, 1\}.
Demostración. Tras observar los datos, a y b son dos números concretos y \mu es una constante desconocida. El enunciado «a \le \mu \le b» no contiene ninguna variable aleatoria: o es verdadero, y su probabilidad es 1, o es falso, y su probabilidad es 0. No hay un tercer caso, y cuál de los dos ocurre no se puede saber. ∎
La proposición es casi trivial y por eso es fácil de pasar por alto. Lo que descarta es la lectura corriente: dado el intervalo [96.2, 103.8], no es correcto decir «\mu está ahí con probabilidad 0,95». Esa frase le atribuye una distribución a \mu, y en este marco \mu no la tiene.
Lo que sí se puede afirmar es sobre el procedimiento: si se repitiera el experimento muchas veces y cada vez se construyera el intervalo con esta fórmula, el 95 % de esos intervalos contendría \mu. Eso es lo que mide el segundo número del pie del visual, y es lo que se mantiene estable al pulsar Otras 100 muestras, mientras el primero baila.
La pregunta «¿con qué probabilidad está \mu aquí dentro?» es legítima, y es la que casi todo el mundo quiere hacer. Lo que ocurre es que para responderla hace falta tratar \mu como variable aleatoria, es decir, darle una distribución previa. Eso es exactamente lo que hace el enfoque bayesiano, y el objeto que resulta se llama intervalo de credibilidad. No es este. La lección 18 lo construye y las diferencias numéricas entre ambos se ven allí.
4. \sigma desconocida: el primer fallo de cobertura
En la práctica \sigma casi nunca se conoce. El reflejo natural es sustituirla por s y dejar el resto igual. Ese reflejo tiene un coste medible.
Para enunciar cuál hace falta una distribución más.
Definición 9.5 (distribución t de Student). T_\nu tiene densidad f(t;\nu) = \frac{\Gamma\!\big(\frac{\nu+1}{2}\big)}{\sqrt{\nu\pi}\,\Gamma\!\big(\frac{\nu}{2}\big)}\Big(1+\frac{t^2}{\nu}\Big)^{-\frac{\nu+1}{2}}, simétrica alrededor de cero, con colas más pesadas que la normal para todo \nu finito, y que converge a la normal estándar cuando \nu \to \infty.
Teorema 9.6 (sin demostrar aquí). Si x_1,\dots,x_n es una muestra de una \mathcal{N}(\mu,\sigma^2), entonces \frac{\bar{x}-\mu}{s/\sqrt{n}} \sim T_{n-1}, donde s^2 = Q/(n-1) es el estimador insesgado de la varianza.
La demostración necesita dos hechos que esta lección todavía no tiene: que Q/\sigma^2 sigue una distribución \chi^2_{n-1}, y que \bar{x} y s^2 son independientes —algo nada evidente, porque s^2 se calcula restando \bar{x}—. Las dos son consecuencias de descomponer un vector normal en subespacios ortogonales, y por eso se aplazan a la lección 12, donde la normal multivariante da la herramienta. Es el mismo argumento de proyección de la Matemática 5, aplicado a un vector aleatorio.
Proposición 9.7. Bajo las hipótesis del Teorema 9.6, el intervalo \bar{x} \pm z_{\alpha/2}\, s/\sqrt{n} tiene cobertura exactamente P\big(|T_{n-1}| \le z_{\alpha/2}\big), y el intervalo \bar{x} \pm t_{n-1,\,\alpha/2}\, s/\sqrt{n}, donde t_{n-1,\,\alpha/2} es el cuantil correspondiente de la t, tiene cobertura exactamente 1-\alpha.
Demostración. Escribiendo T = (\bar{x}-\mu)/(s/\sqrt{n}), la misma reordenación de la Proposición 9.3 —válida porque s/\sqrt{n} > 0— da \mu \in \Big[\bar{x} - c\,\frac{s}{\sqrt{n}},\; \bar{x} + c\,\frac{s}{\sqrt{n}}\Big] \iff |T| \le c para cualquier constante c > 0. Por el Teorema 9.6, T \sim T_{n-1}, luego la cobertura es P(|T_{n-1}| \le c). Con c = z_{\alpha/2} se obtiene la primera afirmación. Para la segunda, t_{n-1,\alpha/2} está definido precisamente como el valor que hace P(|T_{n-1}| \le c) = 1-\alpha. ∎
Falta saber si P(|T_{n-1}| \le z_{\alpha/2}) queda por encima o por debajo de 1-\alpha. Como la t tiene colas más pesadas que la normal, acumula menos probabilidad en el centro y la cobertura se queda corta. La celda siguiente lo calcula sin simular: integra la densidad de la Definición 9.5 por la regla de Simpson.
Con n = 3 el intervalo que dice cubrir el 95 % cubre el 81 %: uno de cada cinco falla en vez de uno de cada veinte. El déficit se cierra despacio y sigue habiendo medio punto porcentual con n = 200.
El visual repite el cálculo por simulación y añade las otras dos curvas.
La lectura importante es cuál de las tres curvas está en su sitio y por qué. La de \sigma conocida está en el nominal por la Proposición 9.3, que es exacta. La de s con cuantil z está por debajo por la Proposición 9.7. La de s con cuantil t vuelve al nominal, también por la Proposición 9.7: el cuantil t está definido justamente para eso. El arreglo está en usar el cuantil correcto, no en reunir más datos.
Con n grande la diferencia se vuelve irrelevante —t_{199} vale 1,972 frente a z = 1,960— y por eso mucha gente usa z sin consecuencias. El problema aparece exactamente donde más caro es equivocarse: muestras pequeñas.
5. Una proporción: el segundo fallo
El caso de una proporción es el intervalo más usado que existe —encuestas, tasas de conversión, tasas de fallo— y el que peor se comporta.
Definición 9.8 (intervalo de Wald). Con k éxitos en n intentos y \hat{p} = k/n, \hat{p} \pm z_{\alpha/2}\sqrt{\frac{\hat{p}(1-\hat{p})}{n}}.
Sale de aplicar la Proposición 9.3 a una Bernoulli, cuya varianza es p(1-p) (Proposición 4.7), sustituyendo el p desconocido de la varianza por \hat{p}. Ese último paso es el que rompe.
Proposición 9.9. Para todo n fijo y todo z > 0, la cobertura del intervalo de Wald tiende a cero cuando p \to 0^{+}.
Demostración. Si k = 0 entonces \hat{p} = 0, la raíz vale \sqrt{0 \cdot 1/n} = 0 y el intervalo se reduce al punto \{0\}, que no contiene ningún p > 0. Por tanto, para p > 0, \text{cobertura}(p) \le P(k \ge 1) = 1 - (1-p)^{n}. Cuando p \to 0^{+}, (1-p)^{n} \to 1 y la cota tiende a cero. ∎
Ocurre con cualquier suceso poco frecuente, no solo en los extremos. Un intervalo que ante cero éxitos responde «p está entre 0 y 0» con un 95 % de confianza no está siendo conservador, está siendo falso.
El visual calcula la cobertura exacta, sin simular: para cada p suma las probabilidades binomiales de los k cuyo intervalo contiene ese p.
Los dientes de sierra son reales y no un artefacto del dibujo. k solo toma n+1 valores, así que al mover p de forma continua la cobertura salta cada vez que un k entra o sale del conjunto de los que cubren. Por eso la cobertura no converge de forma suave al nominal: oscila alrededor mientras se estrecha.
La curva verde es el intervalo de Wilson, que resuelve el problema: \frac{\hat{p} + \frac{z^2}{2n}}{1+\frac{z^2}{n}} \;\pm\; \frac{z}{1+\frac{z^2}{n}}\sqrt{\frac{\hat{p}(1-\hat{p})}{n} + \frac{z^2}{4n^2}}. No se deriva aquí porque sale de invertir una prueba de hipótesis —resolver en p la desigualdad |\hat{p}-p| \le z\sqrt{p(1-p)/n}, con el p verdadero dentro de la raíz en lugar de \hat{p}— y esa maquinaria es la lección 10. Lo que interesa ahora es la moraleja general: la cobertura real es una propiedad medible de un procedimiento, y hay que medirla en vez de suponerla.
Con n = 100 —una muestra que nadie llamaría pequeña— y p = 0{,}05, el intervalo del 95 % cubre menos del 88 %. La columna de p = 0{,}5 se porta mucho mejor: el problema está en dónde cae p, no en el tamaño de la muestra.
Ejercicios
Ejercicio 1 — Medir la cobertura
Estimar por simulación la cobertura real del intervalo \bar{x} \pm 1{,}96\,s/\sqrt{n} con n = 5 y población normal, y compararla con el valor exacto P(|T_4| \le 1{,}96) \approx 0{,}8784. Devolver la cobertura medida.
El semiancho de cada intervalo es z * eses / np.sqrt(n), distinto en cada réplica. La condición es que np.abs(medias - MU) no lo supere. El resultado es un vector de booleanos, uno por réplica.
cubre = np.abs(medias - MU) <= z * eses / np.sqrt(n)La cobertura medida cae cerca del 87,8 % exacto y a más de siete puntos del 95 % nominal. Nótese que eses cambia de réplica en réplica: los intervalos no solo están descentrados de forma distinta, también tienen anchuras distintas, y son los estrechos los que fallan.
Ejercicio 2 — El peor p
Con n = 40 y nominal 95 %, recorrer p en una rejilla fina y encontrar el valor donde la cobertura exacta del intervalo de Wald es menor, ignorando los extremos (p entre 0,02 y 0,98). Devolver esa cobertura mínima.
cobertura_wald recibe un p escalar, así que hay que evaluarla punto a punto y juntar los resultados: np.array([cobertura_wald(p, n) for p in rejilla]).
cobs = np.array([cobertura_wald(p, n) for p in rejilla])El mínimo cae en p = 0{,}02, el borde de la rejilla, con una cobertura del 55,3 % frente al 95 % nominal. Si la rejilla se acercara más a cero seguiría bajando, sin más cota inferior que el cero: eso es la Proposición 9.9. El mínimo no está en el interior, está donde se corte el rango.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 09:
- Escribir
cobertura(constructor, generador, theta, n, reps)que mida la cobertura real de cualquier procedimiento de intervalo. Usarla para comparar los tres intervalos de la sección 4 sobre tres poblaciones: normal, exponencial y de cola pesada. La t supone normalidad; medir cuánto se desvía cuando esa hipótesis no se cumple. - Reproducir el visual de la sección 5 con
matplotlibpara n \in \{10, 25, 50, 100\}, superponiendo Wald, Wilson y el intervalo de Agresti-Coull (\hat{p} calculado tras sumar dos éxitos y dos fracasos). Decidir cuál se recomendaría por defecto y con qué argumento. - La anchura del intervalo también importa: un intervalo de (-\infty,\infty) tiene cobertura perfecta y es inútil. Medir la anchura media de los tres intervalos del apartado 1 junto con su cobertura, y presentar los resultados como pares (cobertura, anchura). ¿Alguno domina a otro en las dos dimensiones a la vez?
Del libro
Think Stats se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.
A 90% confidence interval contains 90% of the values in the sampling distribution, which we can find by computing the 5th and 95th percentiles.
Downey, Think Stats 3e, §8.6 Confidence Intervals
Es la misma construcción de la Proposición 9.3 por otra vía. Aquí se recorta la distribución muestral con la fórmula \pm z_{\alpha/2}\sigma/\sqrt{n}, que es exacta cuando la población es normal; Downey la recorta por percentiles de una distribución muestral simulada, que no necesita fórmula ni supone normalidad. Los dos caminos se encuentran en la lección 11.
Preguntas para leer §8 con lápiz:
- §8.4 Sampling Distributions construye la distribución muestral por simulación. ¿Qué se está suponiendo conocido en esa simulación que en un problema real no se conocería?
- §8.5 se titula Standard Error. ¿Qué relación establece entre el error estándar y la anchura del intervalo de §8.6? Contrastarla con la Proposición 9.3, donde la anchura es 2z_{\alpha/2}\,\text{EE}.
- §8.7 Sources of Error enumera fuentes de error distintas del muestreo aleatorio. Ninguna de ellas entra en la cobertura de la Definición 9.1. ¿Qué significa eso para un intervalo calculado sobre datos con sesgo de selección?
Para el Cerebro
Nota nueva en 10-Conceptos/intervalo-de-confianza.md, enlazada a [[estimacion]], [[teorema-central-limite]] y [[distribucion-muestral]]. La Proposición 9.4 conviene copiarla literal: es la frase que hay que tener a mano cada vez que alguien lea un intervalo en voz alta.
¿Qué es un intervalo de confianza?::Un intervalo aleatorio cuyos extremos son estadísticos, construido de modo que contenga al parámetro con probabilidad 1 − α, para todo valor del parámetro
¿Qué es aleatorio en un intervalo de confianza?::Los extremos. El parámetro es una constante desconocida
¿Es correcto decir que μ está en [96.2, 103.8] con probabilidad 0.95?::No. Una vez calculados los extremos, esa probabilidad es 0 o 1; el 95 % describe el procedimiento, no esa línea
¿Dónde vive entonces el 95 %?::En la frecuencia con la que el procedimiento acierta al repetirlo: 95 de cada 100 intervalos construidos así contienen μ
¿Cuál es el intervalo para la media con σ conocida?::x̄ ± z(α/2)·σ/√n
¿De dónde sale esa fórmula?::De estandarizar x̄ y reordenar la desigualdad |Z| ≤ z despejando μ. Es el mismo suceso escrito al revés
¿Qué es la cobertura nominal?::La que el método anuncia. La real es la que se mide, y no siempre coinciden
¿Qué pasa si se sustituye σ por s y se deja el cuantil z?::La cobertura se queda corta: vale exactamente P(|T_{n−1}| ≤ z), que con n = 5 al 95 % nominal es 87.8 %
¿Cómo se arregla?::Usando el cuantil de la t con n−1 grados de libertad, más ancho que el de la normal
¿Por qué n−1 grados de libertad?::Porque s se calcula restando x̄, que ya se estimó de los mismos datos. La demostración completa está en la lección 12
¿Qué es el intervalo de Wald para una proporción?::p̂ ± z·√(p̂(1−p̂)/n)
¿Cuál es su fallo?::Su cobertura tiende a cero cuando p tiende a cero. Con k = 0 el intervalo es el punto {0} y no cubre ningún p positivo
¿Por qué la cobertura tiene dientes de sierra?::Porque k es entero: al mover p de forma continua, la cobertura salta cuando un k entra o sale del conjunto de los que cubren
¿Qué hacer en la práctica con proporciones?::Usar Wilson o Agresti-Coull, no Wald, sobre todo si p está cerca de 0 o de 1
Fuentes
Lo que esta página demuestra sola. Las Proposiciones 9.3, 9.4, 9.7 y 9.9 se demuestran aquí a partir de la Proposición 6.1 y de la Definición 9.2. Las coberturas de las secciones 4 y 5 no son simuladas: la de la t se obtiene integrando la densidad de la Definición 9.5 por la regla de Simpson, y la del intervalo de Wald sumando las probabilidades binomiales exactas de los k que cubren cada p. Las dos celdas se pueden ejecutar y contrastar con el visual correspondiente.
Lo que se enuncia sin demostrar. El Teorema 9.6 —que (\bar{x}-\mu)/(s/\sqrt{n}) sigue una t_{n-1}— se usa sin demostración; hace falta la distribución de Q/\sigma^2 y la independencia entre \bar{x} y s^2, que llegan con la normal multivariante en la lección 12. También se usa sin demostrar que la t tiene colas más pesadas que la normal, aunque su consecuencia numérica se calcula en la celda de la sección 4. La fórmula del intervalo de Wilson se da sin derivar; sale de invertir la prueba de la lección 10.
Lo que viene de los libros.
- Think Stats 3e (Downey, CC BY-NC-SA 4.0), §8.6 Confidence Intervals y §8.8 Glossary — citadas textualmente arriba.
Lo que es mío, no del libro. La numeración de definiciones y proposiciones. La Proposición 9.4 y su lectura, la Proposición 9.9 con la demostración por el caso k = 0, y el encuadre de las secciones 4 y 5 como dos fallos medibles de cobertura en vez de como recetas, son forma de presentarlo. Think Stats no trata el intervalo de Wald ni la distribución t.
Índices verificados el 12-09-2026 contra el índice publicado del libro.
→ Siguiente: Pruebas de hipótesis