Pruebas de hipótesis: qué responde un valor p
Estadística · Lección 10
Objetivo
Al terminar esta lección se puede:
- Enunciar una hipótesis nula y decir qué cantidad es el valor p y qué cantidad no es.
- Demostrar que el intervalo de confianza de la lección 9 contiene exactamente los valores que esta prueba no rechaza.
- Distinguir error de tipo I de error de tipo II y calcular la potencia de una prueba.
- Demostrar que bajo la hipótesis nula el valor p se reparte uniformemente, y deducir de ahí por qué hacer muchas pruebas produce hallazgos falsos.
De dónde viene
- Lección 2: la Proposición 2.7 —la transformación integral de probabilidad— es lo único que hace falta para demostrar la Proposición 10.8, que es el resultado central de esta lección.
- Lección 6: el teorema central del límite es lo que permite conocer la distribución del estadístico bajo la nula sin suponer que la población sea normal.
- Lección 9: la Proposición 10.5 demuestra que una prueba y un intervalo de confianza son el mismo objeto. Todo lo de allí se reutiliza aquí.
Para qué sirve después
- Lección 11: el bootstrap y las pruebas de permutación calculan el valor p sin fórmula, remuestreando en vez de suponer una distribución.
- Lección 14: cada coeficiente de una regresión trae su propia prueba, que es esta misma con otro error estándar.
- Lección 17: la Proposición 10.9 de aquí es el motor del p-hacking. Sin entenderla, ese capítulo es una lista de reglas; con ella, una consecuencia.
- Aprendizaje automático: comparar dos modelos es una prueba de hipótesis con un estadístico distinto, y la potencia decide cuántos datos de validación hacen falta.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| H_0 | hache sub cero | La hipótesis nula: el modelo bajo el cual se calcula todo |
| H_1 | hache sub uno | La alternativa: lo que se sostiene si se rechaza H_0 |
| \mu_0 | mu sub cero | El valor concreto que H_0 atribuye al parámetro |
| \alpha | alfa | El umbral elegido de antemano; también la probabilidad de error de tipo I |
| \beta | beta | La probabilidad de error de tipo II; la potencia es 1-\beta |
| \delta | delta | El tamaño real del efecto, \mu - \mu_0 |
| p | valor p | La cantidad de la Definición 10.3; no es una probabilidad sobre H_0 |
| m | eme | El número de pruebas que se hacen |
Una advertencia que conviene tener delante toda la lección: en P(\text{dato} \mid H_0) lo que está condicionado es el dato, no la hipótesis. Invertir ese condicional es el error que la sección 2 desmonta.
1. El armazón
Definición 10.1 (hipótesis nula). Un modelo completo de cómo se generaron los datos, suficientemente específico para poder calcular probabilidades bajo él. En esta lección, H_0: \mu = \mu_0 con \sigma conocida.
A model of a system based on the assumption that an effect observed in a sample does not exist in the population.
Downey, Think Stats 3e, §9.6 Glossary, definición de null hypothesis
La palabra clave es modelo. H_0 es una máquina de generar datos, lo bastante concreta como para calcular con ella, y no un deseo ni una sospecha. Si no se puede calcular bajo H_0, no hay prueba.
Definición 10.2 (estadístico de prueba). Una función de la muestra, t = t(x_1,\dots,x_n), elegida de modo que valores grandes sean evidencia contra H_0.
A statistic used in a hypothesis test to quantify the size of an observed effect.
Downey, Think Stats 3e, §9.6 Glossary, definición de test statistic
Definición 10.3 (valor p). Siendo t_{\text{obs}} el valor observado del estadístico, p = P\big(|t| \ge |t_{\text{obs}}| \;\big|\; H_0\big), la probabilidad, calculada suponiendo H_0 cierta, de obtener un efecto al menos tan grande como el observado.
The probability of an effect as big as the observed effect, under a null hypothesis.
Downey, Think Stats 3e, §9.6 Glossary, definición de p-value
2. La prueba z, y qué significa el número
Proposición 10.4. Sea x_1,\dots,x_n una muestra con \sigma conocida, y H_0: \mu = \mu_0. Si bajo H_0 la media muestral es normal, entonces con z = \frac{\bar{x}-\mu_0}{\sigma/\sqrt{n}} el valor p bilateral vale p = 2\big(1-\Phi(|z|)\big), y el unilateral por la derecha, p = 1-\Phi(z).
Demostración. Bajo H_0, la Proposición 9.3 da que z \sim \mathcal{N}(0,1). Por la Definición 10.3, el valor p bilateral es P(|Z| \ge |z|) = P(Z \ge |z|) + P(Z \le -|z|) = \big(1-\Phi(|z|)\big) + \Phi(-|z|). Por la simetría de la normal, \Phi(-a) = 1-\Phi(a), así que los dos sumandos son iguales y la suma es 2(1-\Phi(|z|)). Para el caso unilateral se descarta la cola izquierda y queda P(Z \ge z) = 1-\Phi(z). ∎
El área sombreada es el valor p, y de ahí se lee directamente qué afirma y qué no.
Lo que afirma: si H_0 fuera cierta, un resultado al menos tan extremo como el observado tendría esa probabilidad. Es una afirmación sobre los datos, condicionada a la hipótesis.
Lo que no afirma, y conviene decirlo con el condicional a la vista:
- p no es P(H_0 \text{ cierta} \mid \text{datos}). Es P(\text{datos al menos así} \mid H_0). Los dos condicionales están al revés y no tienen por qué parecerse.
- p no es la probabilidad de haberse equivocado al rechazar.
- p pequeño no significa efecto grande. Moviendo n en el visual sin tocar el efecto, p baja sola: con muestras grandes, cualquier diferencia distinta de cero acaba siendo significativa. Significancia y tamaño del efecto son cosas distintas, y la segunda es la que suele importar.
An effect is statistically significant if the p-value is smaller than a chosen threshold, often 5%.
Downey, Think Stats 3e, §9.6 Glossary, definición de statistically significant
Nótese el «chosen»: el umbral se elige, no se descubre. El 5 % es una convención heredada, no un resultado matemático, y el valor p es una cantidad continua a la que un corte le quita información. Un p de 0,049 y uno de 0,051 dicen casi lo mismo.
3. Una prueba y un intervalo son el mismo objeto
Proposición 10.5 (dualidad). Bajo las hipótesis de la Proposición 10.4, el conjunto de valores \mu_0 que la prueba bilateral de nivel \alpha no rechaza es exactamente el intervalo de confianza de nivel 1-\alpha de la Proposición 9.3.
Demostración. La prueba no rechaza \mu_0 cuando |z| \le z_{\alpha/2}, es decir, \Big|\frac{\bar{x}-\mu_0}{\sigma/\sqrt{n}}\Big| \le z_{\alpha/2} \iff |\bar{x}-\mu_0| \le z_{\alpha/2}\frac{\sigma}{\sqrt{n}} \iff \mu_0 \in \Big[\bar{x} - z_{\alpha/2}\frac{\sigma}{\sqrt{n}},\; \bar{x} + z_{\alpha/2}\frac{\sigma}{\sqrt{n}}\Big], donde el primer paso multiplica por \sigma/\sqrt{n} > 0 y el segundo desarrolla el valor absoluto. El último conjunto es el intervalo de la Proposición 9.3. ∎
Las dos técnicas que suelen enseñarse por separado son la misma desigualdad leída en dos direcciones. Fijado \mu_0, se pregunta si \bar{x} está lejos; fijado \bar{x}, se pregunta qué \mu_0 quedan cerca. De ahí una consecuencia práctica: publicar el intervalo da toda la información de la prueba y además el tamaño del efecto, mientras que publicar solo «p < 0{,}05» tira esa segunda mitad.
Los dos extremos coinciden hasta la resolución de la rejilla, y lo hacen por la Proposición 10.5, no por casualidad numérica.
4. Los dos errores
Definición 10.6. Un error de tipo I es rechazar H_0 siendo cierta; su probabilidad se denota \alpha. Un error de tipo II es no rechazarla siendo falsa; su probabilidad se denota \beta. La potencia de la prueba es 1-\beta: la probabilidad de detectar un efecto que sí existe.
Proposición 10.7. Para la prueba unilateral que rechaza cuando z > z_\alpha:
- P(\text{error de tipo I}) = \alpha exactamente, para todo n y todo \sigma.
- Si el efecto real es \delta = \mu - \mu_0, la potencia vale 1-\beta = 1 - \Phi\big(z_\alpha - \delta\sqrt{n}/\sigma\big).
Demostración. (1) Bajo H_0 se tiene z \sim \mathcal{N}(0,1), luego P(z > z_\alpha) = 1-\Phi(z_\alpha) = \alpha por la Definición 9.2. Ni n ni \sigma aparecen: el umbral se fijó en la escala estandarizada justamente para eso.
- Si la media verdadera es \mu = \mu_0 + \delta, entonces z = \frac{\bar{x}-\mu_0}{\sigma/\sqrt{n}} = \frac{\bar{x}-\mu}{\sigma/\sqrt{n}} + \frac{\delta}{\sigma/\sqrt{n}} = Z + \frac{\delta\sqrt{n}}{\sigma}, con Z \sim \mathcal{N}(0,1). La distribución de z es entonces la normal estándar desplazada \delta\sqrt{n}/\sigma unidades. Por tanto 1-\beta = P(z > z_\alpha) = P\Big(Z > z_\alpha - \frac{\delta\sqrt{n}}{\sigma}\Big) = 1-\Phi\Big(z_\alpha - \frac{\delta\sqrt{n}}{\sigma}\Big). \qquad ∎
Tres lecturas del visual, y la tercera es la que decide cómo se diseña un experimento.
La primera: el área roja no se mueve al cambiar n ni \delta. Es el apartado (1) de la proposición: el error de tipo I lo fija el umbral y nada más.
La segunda: bajando \alpha, el umbral se corre a la derecha; el área roja encoge y la naranja crece. Los dos errores no se pueden bajar a la vez moviendo el umbral, solo intercambiarse.
La tercera: lo único que baja los dos a la vez es separar las curvas, y la separación vale \delta\sqrt{n}/\sigma. Como \delta y \sigma vienen dados por el problema, el único mando disponible es n. Y entra por la raíz: para reducir a la mitad el tamaño del efecto detectable hay que cuadruplicar la muestra. Esa cuenta —fijar \alpha y la potencia deseada y despejar n— es lo que se llama cálculo del tamaño muestral, y se hace antes de recoger los datos, no después.
5. Bajo la nula, el valor p es uniforme
Este es el resultado del que cuelga todo lo demás, y sale gratis de la lección 2.
Proposición 10.8. Si H_0 es cierta y el estadístico de prueba tiene distribución continua, entonces el valor p se distribuye uniformemente en [0,1].
Demostración. Sea T el estadístico y F su función acumulada bajo H_0, continua por hipótesis. Para la versión unilateral, p = 1 - F(T). Por la Proposición 2.7 —la transformación integral de probabilidad—, si T tiene acumulada continua F entonces F(T) \sim \mathcal{U}(0,1). Y si U \sim \mathcal{U}(0,1) también 1-U \sim \mathcal{U}(0,1), porque para 0 \le a \le 1 P(1-U \le a) = P(U \ge 1-a) = 1-(1-a) = a, que es la acumulada de una uniforme. Luego p \sim \mathcal{U}(0,1). ∎
La consecuencia inmediata es la razón de ser del umbral: P(p < \alpha \mid H_0) = \alpha, que es el apartado (1) de la Proposición 10.7 dicho de otra manera. Pero leído al revés dice algo menos cómodo: cuando no hay absolutamente nada que encontrar, el valor p sigue siendo un número entre 0 y 1 elegido al azar, y uno de cada veinte cae por debajo de 0,05.
Con \delta = 0 el histograma es plano dentro del ruido de muestreo. No hay ninguna zona preferida: el valor p no «sabe» que H_0 es cierta. Al subir \delta, la masa se corre hacia el cero y la fracción por debajo de 0,05 sube: esa fracción es la potencia del visual anterior, medida en vez de calculada.
Proposición 10.9 (pruebas múltiples). Si se realizan m pruebas independientes, todas con H_0 cierta, y se declara hallazgo cuando alguna da p < \alpha, entonces P(\text{al menos un hallazgo}) = 1-(1-\alpha)^{m}.
Demostración. Por la Proposición 10.8, cada prueba da p < \alpha con probabilidad exactamente \alpha. Por independencia, la probabilidad de que ninguna lo haga es el producto (1-\alpha)^{m}. El complemento es la expresión del enunciado. ∎
Con catorce pruebas ya es más probable encontrar algo que no encontrarlo, sin que exista ningún efecto. La corrección de Bonferroni —dividir el umbral entre m— mantiene la probabilidad global cerca del 5 %; el precio es una pérdida de potencia en cada prueba individual, que se paga en errores de tipo II. La lección 17 recoge esta cuenta y sus alternativas.
La Proposición 10.9 supone que m está fijado de antemano. En la práctica el número de pruebas hechas suele ser mayor que el número reportado: probar tres estadísticos y publicar el mejor son tres pruebas, no una. Eso es lo que hace del p-hacking un problema de contabilidad antes que de estadística.
Ejercicios
Ejercicio 1 — Potencia medida contra potencia calculada
Simular 40 000 experimentos con n = 36, \sigma = 1 y efecto real \delta = 0{,}4, aplicar la prueba unilateral de nivel 0,05 en cada uno, y comparar la fracción que rechaza con la fórmula de la Proposición 10.7. Devolver la fracción medida.
zs > z_alfa da un vector de booleanos, uno por experimento. La media de un vector de booleanos es la fracción de verdaderos.
potencia_medida = (zs > z_alfa).mean()El desplazamiento vale 0{,}4 \cdot 6 = 2{,}4, y 1-\Phi(1{,}6449-2{,}4) = 1-\Phi(-0{,}7551) = \Phi(0{,}7551) \approx 0{,}775. La medida cae a menos de medio punto de ahí. Nótese que con un efecto de casi media desviación típica y 36 datos, la prueba todavía falla una de cada cuatro veces: la potencia se agota mucho más despacio de lo que la intuición sugiere.
Ejercicio 2 — Uniformidad bajo la nula
Simular 50 000 experimentos sin efecto (\delta = 0), calcular el valor p bilateral de cada uno y comprobar la Proposición 10.8: la fracción con p < u debe valer aproximadamente u. Devolver la mayor desviación absoluta sobre la rejilla de u.
(ps < u).mean() da la fracción para un u concreto. Hay que hacerlo para cada u de us y juntar los resultados en un array.
fracs = np.array([(ps < u).mean() for u in us])Todas las fracciones caen a menos de 0,01 de su u. La desviación que queda es ruido de muestreo: con 50 000 réplicas el error estándar de una proporción cercana a 0,5 ronda 0,002.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 10:
- Escribir
curva_potencia(n, sigma, alfa)que devuelva la potencia en función de \delta, yn_necesario(delta, sigma, alfa, potencia)que despeje el tamaño muestral. Graficar familias de curvas para \alpha \in \{0{,}01, 0{,}05, 0{,}10\} y comprobar que n escala como 1/\delta^2. - Repetir el visual de la sección 5 con una población no normal —exponencial, por ejemplo— y n pequeña. El estadístico ya no es normal bajo H_0, así que la Proposición 10.4 deja de aplicarse. Medir cuánto se aparta de la uniforme el histograma de los valores p, y desde qué n deja de notarse.
- Simular el p-hacking: generar datos sin efecto ninguno, probar diez variables distintas y quedarse con la mejor. Repetir 10 000 veces y medir con qué frecuencia se publica un «hallazgo» con p < 0{,}05. Contrastar el resultado con la Proposición 10.9 y comprobar que Bonferroni lo devuelve al 5 %.
Del libro
Think Stats se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente. Las cuatro definiciones de la sección 1 están tomadas de su glosario, §9.6.
El enfoque del capítulo 9 es distinto al de esta lección y complementario. Aquí la distribución bajo H_0 se obtiene con fórmula, apoyándose en la Proposición 9.3; Downey la obtiene simulando: baraja las etiquetas o resortea los datos y mira dónde cae el estadístico observado. El resultado es el mismo valor p, pero el camino no necesita suponer normalidad ni conocer \sigma. Esa es la maquinaria de la lección 11.
Preguntas para leer §9 con lápiz:
- §9.1 se titula Flipping Coins. ¿Qué estadístico de prueba usa ahí, y por qué ese y no la simple cuenta de caras? Contrastarlo con la Definición 10.2.
- §9.3 Other Test Statistics cambia el estadístico manteniendo los mismos datos. ¿Cambia el valor p? ¿Qué dice eso sobre lo que hay de elección —y no de descubrimiento— en una prueba de hipótesis?
- §9.2 Testing a Difference in Means y §9.5 Testing Proportions resuelven dos problemas distintos con el mismo esquema. Enumerar los cuatro pasos comunes a los dos, y comprobar que la prueba z de la sección 2 de aquí también los sigue.
Para el Cerebro
Nota nueva en 10-Conceptos/prueba-de-hipotesis.md, enlazada a [[intervalo-de-confianza]], [[distribucion-muestral]] y [[pmf-cdf]]. La Proposición 10.5 conviene escribirla a mano: es la que evita aprenderse dos veces la misma fórmula.
¿Qué es una hipótesis nula?::Un modelo completo de cómo se generaron los datos, lo bastante concreto para poder calcular probabilidades bajo él
¿Qué es el valor p?::La probabilidad de un efecto al menos tan grande como el observado, calculada suponiendo H0 cierta
¿El valor p es la probabilidad de que H0 sea cierta?::No. Es P(datos | H0), no P(H0 | datos). Los condicionales están al revés
¿Un p pequeño significa que el efecto es grande?::No. Con n grande cualquier efecto distinto de cero acaba dando p pequeño. Significancia y tamaño del efecto son cosas distintas
¿Qué relación hay entre una prueba y un intervalo de confianza?::El intervalo contiene exactamente los μ0 que la prueba no rechaza. Son la misma desigualdad leída en dos direcciones
¿Por qué conviene publicar el intervalo y no solo el p?::Porque el intervalo trae la misma información de la prueba más el tamaño del efecto
¿Qué es un error de tipo I?::Rechazar H0 siendo cierta. Su probabilidad es α, y la fija el umbral
¿Qué es un error de tipo II?::No rechazar H0 siendo falsa. Su probabilidad es β
¿Qué es la potencia?::1 − β: la probabilidad de detectar un efecto que sí existe
¿Se pueden bajar los dos errores moviendo el umbral?::No. Mover el umbral los intercambia. Para bajar los dos hay que separar las distribuciones, y eso solo lo hace n
¿Cuánto vale la separación entre las dos distribuciones?::δ√n/σ. Como δ y σ vienen dados, el único mando es n, y entra por la raíz
¿Cómo se distribuye el valor p si H0 es cierta?::Uniformemente en [0,1], por la transformación integral de probabilidad
¿Qué consecuencia tiene esa uniformidad?::Que sin ningún efecto real, uno de cada veinte experimentos da p < 0.05
¿Cuál es la probabilidad de un falso hallazgo con m pruebas independientes?::1 − (1−α)^m. Con m = 14 y α = 0.05 ya pasa del 50 %
¿Qué hace la corrección de Bonferroni?::Usar α/m en cada prueba, lo que devuelve la probabilidad global cerca de α a costa de potencia
Fuentes
Lo que esta página demuestra sola. Las Proposiciones 10.4, 10.5, 10.7, 10.8 y 10.9 se demuestran aquí, a partir de la Proposición 2.7 (transformación integral de probabilidad), la Proposición 9.3 y la Definición 9.2. La dualidad de la Proposición 10.5 se comprueba además numéricamente en la celda de la sección 3, calculando el intervalo y el conjunto de no rechazados por caminos independientes. Los tres visuales se contrastaron contra scipy.stats antes de publicarse: el valor p, la potencia y la fracción de significativos coinciden con los valores exactos en las combinaciones probadas.
Lo que viene de los libros.
- Think Stats 3e (Downey, CC BY-NC-SA 4.0), §9.6 Glossary — citadas textualmente las definiciones de null hypothesis, test statistic, p-value y statistically significant.
Lo que es mío, no del libro. La numeración de definiciones y proposiciones. La Proposición 10.5 y su demostración, la deducción de la Proposición 10.8 desde la Proposición 2.7 de la lección 2, y el encuadre de la sección 5 como puente hacia el p-hacking, son forma de presentarlo. Think Stats construye la distribución nula por simulación y no deriva la prueba z ni la potencia.
Índices verificados el 12-09-2026 contra el índice publicado del libro.
→ Siguiente: Bootstrap