P-hacking y errores frecuentes

Estadística · Lección 17

L4 Derivación Fase F1 Libro ISLP cap. 13 Prereqs Pruebas de hipótesis · Calibración

Objetivo

Al terminar esta lección se puede:

  1. Demostrar que el menor de m valores p no es uniforme sino \text{Beta}(1,m), y calcular cuánto vale reportar solo la prueba que salió bien.
  2. Distinguir la tasa de error por familia de la tasa de falsos descubrimientos, y demostrar que Bonferroni controla la primera sin suponer independencia.
  3. Demostrar que Holm rechaza siempre al menos tanto como Bonferroni conservando la misma garantía, y explicar qué gana Benjamini-Hochberg a cambio de qué.
  4. Medir cuánto infla la tasa de falsos positivos mirar los datos mientras se recogen, y por qué el número de pruebas que cuenta es el de las hechas, no el de las reportadas.

De dónde viene

  • Estadística 10: la Proposición 10.8 —el valor p es uniforme bajo H_0— es el cimiento de todo lo que sigue; y la Proposición 10.9 calculó 1-(1-\alpha)^m, que aquí se convierte en la distribución completa del mínimo.
  • Estadística 9 y 14: la lectura de un intervalo de confianza y de un coeficiente «significativo»; una tabla de regresión con veinte coeficientes son veinte pruebas.
  • Estadística 16: elegir el umbral que hace lucir mejor al modelo, después de ver los datos, es la misma contabilidad tramposa aplicada a la clasificación.
  • Estadística 11: el bootstrap y las pruebas de permutación no son inmunes: repetir una prueba de permutación con varios estadísticos y quedarse con el mejor es exactamente este problema.

Para qué sirve después

  • Fase 2, inferencia bayesiana: la lección 18 empieza por el otro lado —qué probabilidad tiene la hipótesis dados los datos— y eso cambia la contabilidad, no la elimina.
  • Aprendizaje automático: elegir hiperparámetros mirando el conjunto de prueba es p-hacking con otro nombre, y la separación entrenamiento/validación/prueba es la corrección.
  • Lectura crítica: saber qué preguntar ante un hallazgo —cuántas pruebas se hicieron, cuándo se decidió parar, cuántos análisis se probaron— es lo que esta lección deja instalado.

Notación

Símbolo Se lee Significado
m eme Número de pruebas de la familia. Solo en esta lección; en la 15 era el número de casos completos
m_0 eme sub cero Cuántas de esas m hipótesis nulas son ciertas
p_{(1)}\le\dots\le p_{(m)} pe sub paréntesis i Los valores p ordenados de menor a mayor
V ve Número de hallazgos falsos: rechazos con H_0 cierta
R erre Número total de rechazos declarados. Solo en esta lección
\alpha alfa Nivel de cada prueba individual, y objetivo de la tasa por familia
\text{FWER} fuer P(V\ge 1): probabilidad de cometer al menos un error de tipo I en toda la familia
\text{FDR} efe de erre E\!\left[V/\max(R,1)\right]: proporción esperada de falsos entre los hallazgos declarados

1. El mejor de muchos no es uno cualquiera

La Proposición 10.9 calculó la probabilidad de que alguna de m pruebas dé un falso positivo. Con la distribución completa del mínimo se ve mejor de dónde sale el problema.

Proposición 17.1 (distribución del menor valor p). Sean p_1,\dots,p_m los valores p de m pruebas independientes, todas con H_0 cierta y estadístico continuo. Entonces P\big(\min_i p_i \le t\big) = 1-(1-t)^m \quad\text{para todo } t\in[0,1], es decir, \min_i p_i \sim \text{Beta}(1,m), con media \dfrac{1}{m+1}.

Demostración. Por la Proposición 10.8 cada p_i es uniforme en [0,1], de modo que P(p_i > t) = 1-t. Por independencia, P\big(\min_i p_i > t\big) = \prod_{i=1}^{m} P(p_i > t) = (1-t)^m, y el complemento da la acumulada anunciada, que es la de una \text{Beta}(1,m). Su media se obtiene integrando la cola: E\big[\min_i p_i\big] = \int_0^1 P\big(\min_i p_i > t\big)\,dt = \int_0^1 (1-t)^m\,dt = \frac{1}{m+1}.

Escrito así, el p-hacking deja de ser una cuestión de honestidad y pasa a ser una de aritmética: reportar el menor de m valores p como si fuera el de una sola prueba es reportar una \text{Beta}(1,m) llamándola uniforme. Con m=20 el menor valor p vale en promedio 1/21\approx 0{,}048: por debajo de 0,05 sin que exista ningún efecto. El «hallazgo» es el valor esperado del procedimiento.

Las dos columnas de la derecha son la Proposición 17.1: la probabilidad medida coincide con 1-(1-\alpha)^m y el menor valor p medio con 1/(m+1), fila por fila.

2. Dos formas de contar los errores

Con muchas pruebas hay dos cosas distintas que se pueden querer controlar, y confundirlas es el segundo error frecuente de esta lección.

Definición 17.2 (tasa de error por familia). \text{FWER} = P(V \ge 1): la probabilidad de que al menos uno de los hallazgos declarados sea falso.

Definición 17.3 (tasa de falsos descubrimientos). \text{FDR} = E\!\left[\dfrac{V}{\max(R,1)}\right]: la proporción esperada de falsos entre los hallazgos declarados, contando cero cuando no se declara ninguno.

La diferencia importa cuando m es grande. Exigir que la probabilidad de un solo error sea del 5 % en una familia de diez mil pruebas es durísimo; admitir que el 5 % de lo declarado sea falso es una promesa distinta, más débil y a menudo más útil. Las dos son legítimas; lo que no es legítimo es prometer una y controlar la otra.

Proposición 17.4 (Bonferroni). Si se rechaza H_{0i} cuando p_i \le \alpha/m, entonces \text{FWER}\le\alpha, cualquiera que sea la dependencia entre las pruebas.

Demostración. Sea I_0 el conjunto de índices con H_{0i} cierta y A_i=\{p_i\le\alpha/m\}. Cometer al menos un error es el suceso \bigcup_{i\in I_0}A_i. Por subaditividad de la probabilidad —la desigualdad de Boole, que no supone nada sobre la dependencia—, \text{FWER} = P\Big(\bigcup_{i\in I_0}A_i\Big) \le \sum_{i\in I_0}P(A_i) = |I_0|\cdot\frac{\alpha}{m} \le m\cdot\frac{\alpha}{m} = \alpha, usando la Proposición 10.8 para P(A_i)=\alpha/m y |I_0|\le m.

Que no haga falta independencia es lo que hace a Bonferroni utilizable en la práctica, donde las pruebas casi siempre están correlacionadas: veinte coeficientes de una misma regresión, o el mismo efecto medido en veinte subgrupos que comparten datos. El precio es el de la desigualdad: cuanto más correlacionadas estén, más holgada es la cota y más potencia se desperdicia.

La última fila es el caso extremo: con correlación 1 las veinte pruebas son en realidad una sola, la tasa sin corregir vuelve al 5 % y Bonferroni baja al 0,23 %. La cota se cumple siempre —esa es la garantía—, pero pagar \alpha/m cuando las pruebas se repiten unas a otras es tirar potencia a la basura.

Holm mejora eso sin perder la garantía, y con una demostración que cabe en un párrafo.

Proposición 17.5 (Holm). Ordénense los valores p de menor a mayor, p_{(1)}\le\dots\le p_{(m)}. Recórranse en ese orden rechazando H_{(i)} mientras p_{(i)} \le \dfrac{\alpha}{m-i+1}, y párese al primer i que falle. Entonces \text{FWER}\le\alpha, sin suponer independencia, y el procedimiento rechaza siempre al menos tanto como Bonferroni.

Demostración. Lo segundo primero: en el paso i=1 el umbral es \alpha/m, exactamente el de Bonferroni, y en los pasos siguientes es mayor; así que todo lo que Bonferroni rechaza —los p_i \le \alpha/m, que ocupan las primeras posiciones del orden— Holm lo rechaza también.

Para la garantía, supóngase que Holm comete al menos un error, y sea H_{(k)} el primer nulo cierto que rechaza, en la posición k del orden. Las k-1 posiciones anteriores son todas nulos falsos, así que entre las m-k+1 posiciones restantes están todos los nulos ciertos: |I_0| \le m-k+1. Como Holm rechazó en la posición k, p_{(k)} \le \frac{\alpha}{m-k+1} \le \frac{\alpha}{|I_0|}, y p_{(k)} es el valor p de un nulo cierto. Por tanto, si Holm comete algún error, existe un i\in I_0 con p_i \le \alpha/|I_0|, y la probabilidad de eso se acota otra vez por Boole: \text{FWER} \le P\Big(\bigcup_{i\in I_0}\{p_i\le \alpha/|I_0|\}\Big) \le |I_0|\cdot\frac{\alpha}{|I_0|} = \alpha.

Holm es, entonces, gratis en el mismo sentido que la recalibración de la lección 16: misma garantía, nunca menos hallazgos. No hay razón para usar Bonferroni salvo la de explicarlo en una línea.

Procedimiento 17.6 (Benjamini-Hochberg). Con los valores p ordenados, sea k = \max\Big\{i : p_{(i)} \le \frac{\alpha\,i}{m}\Big\} y recházense las k hipótesis con menores valores p (ninguna si el conjunto es vacío). Para pruebas independientes, \text{FDR}\le\alpha.

Demostración parcial. Aquí solo se demuestra el caso en que todas las nulas son ciertas, que es el que interesa cuando se teme que no haya nada. Si m_0=m, todo rechazo es falso, de modo que V=R y \text{FDR} = E\left[\frac{V}{\max(R,1)}\right] = P(R\ge 1) = \text{FWER}, y controlar el FDR equivale a controlar el FWER. El caso general —con m_0<m nulas ciertas, donde BH controla el FDR en \alpha m_0/m pero no el FWER— no se demuestra en esta página; se comprueba numéricamente abajo y queda declarado en Fuentes.

La diferencia entre los tres se ve mejor dibujada: los umbrales de Bonferroni y Holm son rectas casi horizontales cerca de cero, y el de BH es una recta que sube con el rango.

La tabla es la lección entera en cuatro filas. Sin corregir, la probabilidad de publicar al menos un falso hallazgo es del 98,9 %: con cien pruebas, encontrar algo está garantizado. Bonferroni y Holm la devuelven al 5 % prometido —Holm con un poco más de potencia, 46,8 % contra 46,3 %, tal como dice la Proposición 17.5— y BH cambia de promesa: su FDR es del 4,4 %, por debajo del 5 % objetivo, a costa de un FWER del 30 %. Esos 30 puntos son consecuencia de la definición de FDR, no un defecto del procedimiento. BH admite algún falso hallazgo con tal de encontrar el 70 % de los efectos reales en vez del 46 %.

3. Mirar mientras se recogen los datos

El caso anterior supone que m está fijado de antemano. El error más común es otro: no saber cuántas pruebas se hicieron. La forma más silenciosa de inflar m es mirar los datos e ir decidiendo si seguir.

Proposición 17.7 (el vistazo repetido). Sea z_n el estadístico calculado con las primeras n observaciones y considérese la regla «mirar en los momentos n_1<\dots<n_K y declarar hallazgo la primera vez que |z_{n_j}|>z_{\alpha/2}». Entonces la tasa de falsos positivos \gamma_K = P\Big(\exists\, j\le K:\ |z_{n_j}|>z_{\alpha/2}\Big) es no decreciente en K, y \gamma_1=\alpha. Es decir: mirar más veces solo puede aumentar la tasa, nunca reducirla.

Demostración. Los sucesos están encajados: si se declara hallazgo mirando en los primeros K momentos, también se declara mirando en los primeros K+1, porque el suceso «alguno de los K primeros cruza» está contenido en «alguno de los K+1 primeros cruza». La probabilidad es monótona respecto de la inclusión, luego \gamma_K \le \gamma_{K+1}. Con un solo momento, la regla es la prueba de la lección 10 y \gamma_1=\alpha por la Proposición 10.8.

La proposición solo dice que la tasa sube. Cuánto sube es una cuenta que no tiene forma cerrada simple, y por eso se mide.

Con un solo análisis al final, el 4,96 % prometido. Con dos, casi el 10 %. Mirando después de cada observación entre n=20 y n=400, el 35,13 %: uno de cada tres experimentos sin ningún efecto termina declarando un hallazgo, y en cada uno de ellos el análisis final está bien hecho. Lo que está mal hecho es la contabilidad de cuántas veces se preguntó.

Warning

Este es el resultado que más cuesta aceptar, porque la regla «paro cuando el resultado sea claro» parece prudente. No lo es: es la que garantiza parar justo en el momento en que el ruido está de nuestro lado. Si hay que mirar sobre la marcha —y muchas veces hay que hacerlo—, existen métodos secuenciales que reparten \alpha entre los vistazos; lo que no se puede es mirar libremente y reportar el umbral de un solo análisis.

4. Qué preguntar ante un hallazgo

Las tres secciones anteriores se resumen en una pregunta de contabilidad: ¿cuántas pruebas se hicieron en realidad? El número casi nunca coincide con el reportado, y las formas de inflarlo son todas inocentes de una en una:

  1. Varios estadísticos. Probar la diferencia de medias, la de medianas y la de varianzas y reportar la que salió: m=3.
  2. Varios subgrupos. El efecto global no sale, pero sí en mujeres mayores de cincuenta: cada subgrupo es una prueba.
  3. Varias variables de resultado. Se midieron ocho cosas y se reporta la que dio: m=8.
  4. Varias decisiones de limpieza. Qué atípicos quitar, qué transformación aplicar, dónde cortar una variable continua. Cada decisión binaria tomada después de ver los datos duplica el número de análisis posibles.
  5. Parar cuando conviene. La Proposición 17.7.

Las cuatro primeras son la Proposición 17.1 con distintos disfraces; la quinta es la 17.7. El Ejercicio 1 mide la cuarta, que es la más difícil de ver porque cada decisión parece técnica y no estadística.

La consecuencia práctica no es dejar de explorar —explorar está bien y es necesario— sino declarar qué se hizo: decidir el análisis antes de ver los datos cuando el objetivo es confirmar, y decir con claridad «esto es exploratorio» cuando no. Un hallazgo exploratorio no es menos valioso; es otra cosa, y se confirma con datos nuevos.

Ejercicios

Ejercicio 1 — El jardín de los senderos que se bifurcan

Cada decisión de análisis tomada después de ver los datos multiplica por dos el número de caminos posibles. Simular un experimento sin ningún efecto y k decisiones binarias, quedarse con el camino que dé el menor valor p, y comparar la tasa de falsos positivos con 1-(1-\alpha)^{2^k}.

Cuatro decisiones —cuatro, no cuarenta— llevan la tasa de falsos positivos al 56 %. Y nadie que lea el informe verá esas cuatro decisiones: verá un análisis, con su valor p por debajo de 0,05.

Ejercicio 2 — Cuánto cuesta corregir

Bonferroni baja el umbral de cada prueba a \alpha/m, y eso cuesta potencia. Calcular, para un efecto real de 0{,}5\sigma, qué potencia queda con n=64 al corregir por m pruebas, y qué n haría falta para mantener la potencia en 0,80. Predecir antes de correr si el costo crece con m o con \log m.

La respuesta es \log m: el cuantil z_{\alpha/m} crece como \sqrt{2\log(m/\alpha)}, y n crece con su cuadrado. Pasar de una prueba a mil multiplica la muestra necesaria por menos de cuatro —de 25 a 90—, no por mil. Corregir por pruebas múltiples es mucho más barato de lo que la intuición sugiere, y desde luego más barato que publicar un hallazgo falso.

Del libro

ISLP dedica su capítulo 13 completo, Multiple Testing, a este material: la tasa de error por familia, Bonferroni, Holm, Benjamini-Hochberg y las pruebas de permutación aplicadas al mismo problema. De ISLP solo está verificado el índice a nivel de capítulo —statlearning.com no publica los títulos de sección—, así que aquí se cita el capítulo y no se le atribuye ninguna frase ni ninguna numeración de sección.

Think Stats llega a las mismas preguntas por el camino computacional del cap. 9 Hypothesis Testing, que la lección 10 ya recorrió: allí todo se resuelve remuestreando en vez de con distribuciones analíticas.

Preguntas para leer ISLP cap. 13 con lápiz:

  1. El capítulo presenta Bonferroni y Holm en el mismo orden que esta lección. ¿En qué punto exacto de la demostración de la Proposición 17.5 se usa que los k-1 rechazos anteriores eran nulos falsos? ¿Qué pasaría con la cota si el primer nulo cierto rechazado estuviera en la posición 1?
  2. ISLP trata también el control del FDR por remuestreo, sin suponer independencia. ¿Qué parte de la Proposición 17.6 dejaría de hacer falta si el umbral se calibrara por permutaciones en vez de con la recta \alpha i/m?
  3. El capítulo distingue entre controlar el error de tipo I antes y después de mirar los datos. Contrastarlo con la Proposición 17.7: ¿es el vistazo repetido un problema de pruebas múltiples, o uno distinto?

Para el Cerebro

Nota nueva en 10-Conceptos/pruebas-multiples.md, enlazada a [[valor-p]], [[error-de-tipo-i]] y [[potencia]]. La Proposición 17.1 conviene rehacerla a mano: sale en tres líneas de la Proposición 10.8 y deja el p-hacking convertido en aritmética.

¿Qué distribución tiene el menor de m valores p bajo H0?::Beta(1,m): P(min ≤ t) = 1−(1−t)^m (Proposición 17.1)
¿Cuánto vale en promedio el menor de m valores p?::1/(m+1) — con m = 20 ya está por debajo de 0,05
¿Qué es la FWER?::P(V ≥ 1): la probabilidad de cometer al menos un error de tipo I en toda la familia
¿Qué es la FDR?::E[V / max(R,1)]: la proporción esperada de falsos entre los hallazgos declarados
¿Bonferroni necesita independencia?::No: sale de la desigualdad de Boole, que no supone nada sobre la dependencia
¿Cuándo es Bonferroni muy conservador?::Cuando las pruebas están correlacionadas; con correlación 1 son una sola prueba
¿Por qué Holm domina a Bonferroni?::Su primer umbral es α/m y los siguientes son mayores: rechaza todo lo que Bonferroni rechaza, y a veces más
¿Qué controla BH y qué no?::Controla la FDR; NO controla la FWER, y por eso encuentra más efectos reales
¿Qué le pasa a la tasa de falsos positivos al mirar los datos varias veces?::Sube, y de forma monótona con el número de vistazos (Proposición 17.7)
¿Cuánto sube mirando todo el tiempo entre n=20 y n=400?::Del 5 % al 35 % aproximadamente, medido por simulación
¿Cuántas pruebas cuentan?::Las hechas, no las reportadas: estadísticos, subgrupos, variables, decisiones de limpieza y vistazos
¿Cuánto cuesta corregir por m pruebas?::El umbral baja como α/m pero el n necesario crece con log m: de 1 a 1000 pruebas, menos de cuatro veces
¿Qué hay que declarar para que un hallazgo sea interpretable?::Cuántas pruebas se hicieron, cuándo se decidió parar y qué se decidió después de ver los datos

Fuentes

Lo que esta página demuestra sola. Las Proposiciones 17.1, 17.4, 17.5 y 17.7 se demuestran aquí, a partir de la Proposición 10.8 (el valor p es uniforme bajo H_0), la desigualdad de Boole y la monotonía de la probabilidad. Se comprueban además numéricamente: la acumulada del mínimo y su media contra 1-(1-t)^m y 1/(m+1) en cinco valores de m; la cota de Bonferroni en cuatro niveles de correlación, incluida la correlación 1; FWER, FDR y potencia de los cuatro procedimientos sobre 20 000 experimentos de 100 pruebas; la tasa de falsos positivos con 1, 2, 5, 10, 20 y 381 vistazos; y el jardín de los senderos que se bifurcan contra 1-(1-\alpha)^{2^k}. Los tres visuales se contrastaron contra numpy antes de publicarse.

Lo que se usa de otras lecciones sin repetir. Que el valor p es uniforme bajo H_0 es la Proposición 10.8, y la cuenta 1-(1-\alpha)^m es la Proposición 10.9. La potencia de la prueba unilateral y su fórmula son la Proposición 10.7.

Lo que se enuncia sin demostrar. El control del FDR por Benjamini-Hochberg en el caso general —con m_0<m nulas ciertas— se enuncia y se comprueba numéricamente, pero no se demuestra: aquí solo se demuestra el caso m_0=m, donde FDR y FWER coinciden. La demostración general necesita un argumento sobre los valores p ordenados que no cabe en esta página. También se menciona sin demostrar que con vistazos ilimitados la tasa de falsos positivos tiende a 1; eso es consecuencia de la ley del logaritmo iterado, que este plan no ha visto.

Lo que viene de los libros.

  • ISLP, cap. 13 Multiple Testing — citado por número y título de capítulo. De ISLP solo está verificado el índice a ese nivel, así que no se cita ninguna sección ni se transcribe texto.
  • Think Stats 3e, cap. 9 Hypothesis Testing — mencionado como el camino computacional al mismo problema, ya recorrido en la lección 10.

Lo que es mío, no del libro. La numeración y la organización en tres mecanismos —muchas pruebas, muchos caminos, muchos vistazos— con la Proposición 17.1 como raíz común de los dos primeros. La demostración de Holm presentada como «el primer nulo cierto que se rechaza acota |I_0|», y la lectura de la Proposición 17.7 como monotonía de sucesos encajados, que es lo que la hace demostrable en dos líneas sin teoría de martingalas.

Índices verificados el 12-09-2026 contra los índices publicados de cada libro.