Distribuciones predictivas
Estadística · Lección 20
Objetivo
Al terminar esta lección se puede:
- Distinguir la distribución predictiva de la distribución del parámetro, y demostrar que la predictiva es la mezcla de las distribuciones de muestreo ponderada por el posterior.
- Derivar en forma cerrada las dos predictivas que se usan: la Beta-binomial a partir de un posterior Beta, y la binomial negativa a partir de un posterior Gamma.
- Demostrar que la predictiva siempre es más ancha que la distribución de enchufe, y cuantificar la diferencia con la descomposición de la varianza total.
- Explicar por qué un intervalo construido enchufando la estimación puntual no cubre lo que promete, y medir el defecto de cobertura.
De dónde viene
- Estadística 19: los posteriores conjugados. Aquí se integran esos posteriores contra la verosimilitud, y la integral vuelve a salir cerrada.
- Estadística 18: la evidencia m(x) del teorema de Bayes ya era una predictiva, la previa. Esta lección le da nombre y la usa.
- Estadística 4: la descomposición de la varianza total, \text{Var}(Y)=E[\text{Var}(Y\mid X)]+\text{Var}(E[Y\mid X]), es el único ingrediente de la Proposición 20.8.
- Estadística 7: el estimador de enchufe —estimar el parámetro y luego tratarlo como si fuera el verdadero— es el hábito que esta lección cuantifica.
Para qué sirve después
- Lección 21: la predictiva previa evaluada en los datos observados es la verosimilitud marginal del modelo, y comparar modelos es comparar predictivas.
- Lección 24: en un muestreador MCMC la predictiva se obtiene simulando un dato por cada muestra de la cadena; el resultado de esta lección dice qué tiene que salir.
- Estadística 16: un pronóstico probabilístico honesto es una predictiva, no una estimación puntual; la Proposición 20.8 dice exactamente cuánta dispersión se pierde al confundirlas.
- Estadística 11: el bootstrap resuelve el mismo problema —propagar la incertidumbre del parámetro al pronóstico— sin prior y por remuestreo.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| \tilde{x} | equis tilde | Un dato futuro, todavía no observado |
| x | equis | Los datos ya observados |
| \tilde{n} | ene tilde | Cuántos ensayos futuros se van a observar |
| p(\tilde{x}\mid x) | pe de equis tilde dado equis | La predictiva posterior |
| m(x) | eme de equis | La predictiva previa, o verosimilitud marginal |
| \text{BetaBin}(\tilde{n},a,b) | beta binomial | La predictiva de \tilde{n} ensayos bajo un posterior \text{Beta}(a,b) |
| \text{BinNeg}(a,p) | binomial negativa | La predictiva de un conteo bajo un posterior \text{Gamma} |
1. Qué se pregunta
Hay dos preguntas distintas y se confunden con facilidad. «¿Cuánto vale \theta?» se responde con el posterior de la lección 19. «¿Cuánto va a valer el próximo dato?» se responde con otra cosa, que vive en el espacio de los datos y no en el de los parámetros.
Definición 20.1 (predictiva previa). Antes de observar nada, la distribución del dato es m(\tilde{x})=\int p(\tilde{x}\mid\theta)\,\pi(\theta)\,d\theta .
Definición 20.2 (predictiva posterior). Tras observar x, la distribución del dato futuro \tilde{x} es p(\tilde{x}\mid x)=\int p(\tilde{x}\mid\theta)\,\pi(\theta\mid x)\,d\theta, bajo el supuesto de que \tilde{x} y x son independientes dado \theta.
Las dos son la misma operación con distinto prior: la previa integra contra \pi, la posterior contra \pi(\cdot\mid x). Y la Definición 20.1 ya había aparecido: es el denominador del teorema de Bayes, que en la lección 19 se descartó por ser constante en \theta. Aquí es la respuesta.
Proposición 20.3 (la predictiva es una mezcla, y es una distribución). La predictiva posterior es la mezcla de las distribuciones de muestreo p(\cdot\mid\theta) con pesos dados por el posterior. En particular es una distribución de probabilidad legítima: es no negativa y suma —o integra— uno.
Demostración. La no negatividad es inmediata porque el integrando es producto de dos cantidades no negativas. Para la masa total, integrando en \tilde{x} e intercambiando el orden de integración —lícito por no negatividad—, \int p(\tilde{x}\mid x)\,d\tilde{x}=\int\!\!\int p(\tilde{x}\mid\theta)\,\pi(\theta\mid x)\,d\theta\,d\tilde{x} =\int \pi(\theta\mid x)\Big[\int p(\tilde{x}\mid\theta)\,d\tilde{x}\Big]d\theta . El corchete vale uno para cada \theta, por ser p(\cdot\mid\theta) una distribución. Queda \int\pi(\theta\mid x)d\theta=1. Que sea una mezcla es la lectura directa de la fórmula: cada \theta aporta su distribución de muestreo, pesada por lo que el posterior le concede. ∎
Esa lectura como mezcla es la que hace predecible el resultado de las dos secciones siguientes. Una mezcla de binomiales todas con el mismo \tilde{n} pero distinto \theta no es una binomial, y una mezcla de Poissons con distinta media no es una Poisson. Sale otra cosa, más ancha, y en los dos casos conjugados esa otra cosa tiene nombre.
2. La predictiva Beta-binomial
Proposición 20.4 (predictiva de un posterior Beta). Si \theta\mid x\sim\text{Beta}(a,b) y \tilde{k} es el número de éxitos en \tilde{n} ensayos futuros independientes dado \theta, entonces P(\tilde{k}=j\mid x)=\binom{\tilde{n}}{j}\,\frac{B(a+j,\;b+\tilde{n}-j)}{B(a,b)},\qquad j=0,\dots,\tilde{n}.
Demostración. Por la Definición 20.2, con la densidad Beta escrita entera, P(\tilde{k}=j\mid x)=\int_0^1\binom{\tilde{n}}{j}\theta^{j}(1-\theta)^{\tilde{n}-j}\cdot\frac{\theta^{a-1}(1-\theta)^{b-1}}{B(a,b)}\,d\theta =\frac{\binom{\tilde{n}}{j}}{B(a,b)}\int_0^1\theta^{(a+j)-1}(1-\theta)^{(b+\tilde{n}-j)-1}d\theta . La integral es, por la Definición 19.4, exactamente B(a+j,\,b+\tilde{n}-j). ∎
La cuenta repite la observación de la lección 19 leída al revés. Allí se reconocía el núcleo de una Beta para nombrar el posterior; aquí se reconoce para integrarlo, porque la constante de normalización de una Beta es justamente el valor de esa integral.
Corolario 20.5 (un solo ensayo). Con \tilde{n}=1, la probabilidad de que el próximo ensayo sea un éxito es P(\tilde{k}=1\mid x)=\frac{a}{a+b}, es decir, la media del posterior.
Demostración. Con \tilde{n}=j=1 la Proposición 20.4 da B(a+1,b)/B(a,b). Usando B(\alpha,\beta)=\Gamma(\alpha)\Gamma(\beta)/\Gamma(\alpha+\beta) y la identidad \Gamma(z+1)=z\Gamma(z), \frac{B(a+1,b)}{B(a,b)}=\frac{\Gamma(a+1)\Gamma(b)}{\Gamma(a+b+1)}\cdot\frac{\Gamma(a+b)}{\Gamma(a)\Gamma(b)}=\frac{a\,\Gamma(a)}{(a+b)\,\Gamma(a+b)}\cdot\frac{\Gamma(a+b)}{\Gamma(a)}=\frac{a}{a+b}. ∎
El corolario explica por qué para un pronóstico binario la media posterior basta y la distinción de esta lección parece ociosa: con una sola observación futura de Bernoulli no hay más que un número que dar. La distinción aparece en cuanto se pregunta por más de un dato, o por cualquier cosa que no sea la media.
Combinando con la Proposición 19.5, si el prior era \text{Beta}(a_0,b_0) y se observaron k de n, la probabilidad del próximo éxito es (a_0+k)/(a_0+b_0+n), que con prior uniforme es la regla de sucesión (k+1)/(n+2) de la lección 18. La regla de sucesión es, entonces, una predictiva.
Las dos distribuciones tienen la misma media y varianzas en razón 1{,}6. Eso no es casualidad ni depende del ejemplo, y la sección 4 lo demuestra.
3. La predictiva de un posterior Gamma
Proposición 20.6 (predictiva de un posterior Gamma). Si \lambda\mid x\sim\text{Gamma}(a,b) con b tasa, y \tilde{x}\mid\lambda\sim\text{Poisson}(\lambda), entonces P(\tilde{x}=j\mid x)=\frac{\Gamma(a+j)}{\Gamma(a)\,j!}\left(\frac{b}{b+1}\right)^{a}\left(\frac{1}{b+1}\right)^{j},\qquad j=0,1,2,\dots que es una binomial negativa de parámetros a y p=b/(b+1).
Demostración. Por la Definición 20.2, P(\tilde{x}=j\mid x)=\int_0^\infty \frac{\lambda^{j}e^{-\lambda}}{j!}\cdot\frac{b^{a}}{\Gamma(a)}\lambda^{a-1}e^{-b\lambda}\,d\lambda =\frac{b^{a}}{\Gamma(a)\,j!}\int_0^\infty \lambda^{(a+j)-1}e^{-(b+1)\lambda}\,d\lambda . La integral restante es la constante de normalización de una \text{Gamma}(a+j,\,b+1) puesta del revés, es decir \Gamma(a+j)/(b+1)^{a+j}. Sustituyendo, P(\tilde{x}=j\mid x)=\frac{b^{a}\,\Gamma(a+j)}{\Gamma(a)\,j!\,(b+1)^{a+j}}=\frac{\Gamma(a+j)}{\Gamma(a)\,j!}\Big(\frac{b}{b+1}\Big)^{a}\Big(\frac{1}{b+1}\Big)^{j}. ∎
El mismo movimiento otra vez: se junta todo lo que depende del parámetro, se reconoce el núcleo de una densidad conocida y se cambia la integral por su constante. Las dos demostraciones de esta lección son la misma demostración.
La binomial negativa aparece aquí sin que nadie la haya invocado, y aparece siempre que se promedian Poissons con media incierta. Es la razón de que los conteos reales casi nunca sean Poisson: la Poisson exige que la media sea una constante conocida, y en cuanto la media varía —entre días, entre sujetos, entre lo que sea— lo que se observa es una mezcla, y las mezclas de Poisson están sobredispersas.
El visual siguiente enseña de dónde sale esa anchura. La Proposición 20.3 dice que la predictiva es una mezcla; aquí la mezcla se dibuja con J piezas, cada una una Poisson con su propia media tomada del posterior. Con J pequeño se ven las piezas; al subirlo, su suma se pega a la binomial negativa exacta.
4. La predictiva siempre es más ancha
Las dos razones de varianza de arriba —1{,}6 y 7/6— no son coincidencias del ejemplo. Salen de un único resultado, y el resultado no necesita conjugación ni nada parecido.
Proposición 20.7 (misma media, más varianza). Sea \tilde{x} el dato futuro y \theta\mid x el posterior. Entonces E[\tilde{x}\mid x]=E\big[\,E[\tilde{x}\mid\theta]\,\big],\qquad \text{Var}(\tilde{x}\mid x)=\underbrace{E\big[\text{Var}(\tilde{x}\mid\theta)\big]}_{\text{ruido del muestreo}}+\underbrace{\text{Var}\big(E[\tilde{x}\mid\theta]\big)}_{\text{incertidumbre sobre }\theta}, donde las esperanzas exteriores se toman respecto del posterior. El segundo sumando es \ge0, y vale cero solo si E[\tilde{x}\mid\theta] es constante sobre el soporte del posterior.
Demostración. Es la ley de la esperanza total y la descomposición de la varianza total de la lección 4, aplicadas a la pareja (\tilde{x},\theta) bajo la distribución conjunta p(\tilde{x}\mid\theta)\pi(\theta\mid x). La no negatividad del segundo sumando es la de cualquier varianza, y una varianza es cero exactamente cuando la variable es constante casi seguramente. ∎
Corolario 20.8 (el defecto del enchufe). Sea \hat\theta=E[\theta\mid x] y sea p(\cdot\mid\hat\theta) la distribución de enchufe. Si E[\tilde{x}\mid\theta] es lineal en \theta, las dos distribuciones tienen la misma media y \text{Var}(\tilde{x}\mid x)-\text{Var}_{\text{enchufe}}(\tilde{x})=\text{Var}\big(E[\tilde{x}\mid\theta]\big)+\Big(E\big[\text{Var}(\tilde{x}\mid\theta)\big]-\text{Var}(\tilde{x}\mid\hat\theta)\Big), y en los dos casos de esta lección el resultado es una razón exacta: (a+b+\tilde{n})/(a+b+1) para la Beta-binomial y (b+1)/b para la binomial negativa.
Demostración. La igualdad de medias sale de la Proposición 20.7 y de la linealidad: E[\tilde{x}\mid x]=E[E[\tilde{x}\mid\theta]]=E[\tilde{x}\mid\hat\theta]. La identidad de varianzas es restar y agrupar. Para las razones, en el caso Poisson \text{Var}(\tilde{x}\mid\lambda)=E[\tilde{x}\mid\lambda]=\lambda, luego \text{Var}(\tilde{x}\mid x)=E[\lambda]+\text{Var}(\lambda)=\frac{a}{b}+\frac{a}{b^{2}}=\frac{a}{b}\cdot\frac{b+1}{b}, y el enchufe da \text{Var}=\hat\lambda=a/b, de donde la razón (b+1)/b. En el caso binomial, con \theta\sim\text{Beta}(a,b), media \mu=a/(a+b) y varianza \mu(1-\mu)/(a+b+1), \text{Var}(\tilde{k}\mid x)=E[\tilde{n}\theta(1-\theta)]+\tilde{n}^{2}\text{Var}(\theta) =\tilde{n}\mu(1-\mu)\frac{a+b+\tilde{n}}{a+b+1}, usando E[\theta(1-\theta)]=\mu(1-\mu)-\text{Var}(\theta), mientras que el enchufe da \tilde{n}\mu(1-\mu). ∎
Las dos razones se leen igual de bien. En el caso Poisson, (b+1)/b: con b grande —mucha información sobre \lambda— la razón tiende a uno y el enchufe deja de costar nada. En el caso binomial, (a+b+\tilde{n})/(a+b+1): el exceso crece con \tilde{n}, porque cuantos más datos futuros se predigan, más veces se paga el mismo error sobre \theta; y decrece con a+b, que es el tamaño de muestra acumulado de la lección 19.
El visual siguiente pone las dos distribuciones sobre el mismo eje. El eje horizontal es 0,\dots,\tilde{n} y el vertical está fijo: una predictiva muy concentrada se sale por arriba en vez de reescalar el marco.
5. Qué cuesta el enchufe
La consecuencia práctica no es que las varianzas difieran en un decimal, sino que un intervalo construido con la distribución de enchufe promete una cobertura que no da.
El intervalo de enchufe es un punto más estrecho y cubre casi cinco puntos porcentuales menos de lo que promete. Con conteos pequeños la diferencia parece menor de lo que es, porque la distribución es discreta y los extremos saltan de uno en uno; con \tilde{n} grande el defecto crece con la razón del Corolario 20.8.
Aquí es donde esta lección se junta con la 16. Un pronóstico probabilístico se juzga por su calibración, y un modelo que reporta la distribución de enchufe está sistemáticamente sobreconfiado: concentra más masa cerca del centro de la que el mundo le concede. Ese es el defecto que la predictiva corrige sin ajustar nada, solo integrando.
Ejercicios
- Demostrar que la predictiva previa de la Definición 20.1 evaluada en los datos observados coincide con la evidencia m(x) de la lección 18, y deducir que el teorema de Bayes se puede escribir como posterior = prior × (verosimilitud / predictiva previa).
- Comprobar que con a=b=1 y \tilde{n}=1 la Proposición 20.4 da probabilidad 1/2, y con a=b=1 y \tilde{n} cualquiera da la distribución uniforme sobre \{0,1,\dots,\tilde{n}\}. Interpretar ese resultado.
- En la Proposición 20.6, tomar el límite a\to\infty, b\to\infty con a/b=\lambda_0 fijo, y comprobar que la binomial negativa tiende a una Poisson de media \lambda_0. Relacionarlo con la razón (b+1)/b del Corolario 20.8.
- Demostrar que la Beta-binomial con \tilde{n}=1 es una Bernoulli, y que por tanto el Corolario 20.5 es un caso particular de la Proposición 20.4 y no un resultado aparte.
- Encontrar un caso en que la distribución de enchufe tenga más varianza que la predictiva, o demostrar que no existe cuando E[\tilde{x}\mid\theta] es lineal y \text{Var}(\tilde{x}\mid\theta) es cóncava en \theta.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 20:
- Escribir
predictiva_beta_binomial(a, b, n_fut)ypredictiva_binomial_negativa(a, b, jmax)que devuelvan el vector de probabilidades trabajando en logaritmos. Verificar cada una contra la integral numérica de la Definición 20.2 con al menos 10^5 puntos, a tolerancia 10^{-9}, sobre cincuenta combinaciones de parámetros. - Medir la cobertura real de intervalos de predicción al 50 %, 80 %, 90 % y 95 % construidos de las dos maneras, para \tilde{n}\in\{1,5,20,100\}, simulando al menos 10^5 veces. Hacer una tabla de cobertura prometida contra cobertura obtenida y localizar dónde el enchufe empieza a fallar de verdad.
- Simular una sobredispersión y detectarla: generar conteos de una binomial negativa, ajustarles una Poisson por máxima verosimilitud, y comparar la varianza observada con la que la Poisson predice. Construir con eso una prueba sencilla de sobredispersión y estimar su potencia en función de la razón (b+1)/b.
Del libro
Think Bayes se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.
The distribution of a mixture is the weighted sum of the distributions in the mixture.
Downey, Think Bayes 2e, §7.6 General Mixtures
El libro llega a la mezcla desde el otro lado: la construye para resolver un problema de dados y solo después la usa como predictiva, en §8.6 Predicting the Rematch. Esta página invierte el orden y demuestra primero la Proposición 20.3, de modo que las dos fórmulas cerradas de las secciones 2 y 3 aparecen como casos de un único enunciado.
Preguntas para leer §7 y §8 con lápiz:
- §7.5 Mixture construye la distribución de una tirada cuyo dado se elige al azar. ¿Qué papel juega ahí el posterior de esta lección, y qué cambia si los pesos de la mezcla no suman uno?
- §8.6 Predicting the Rematch predice el resultado de un partido futuro integrando sobre el posterior de la tasa de goles. ¿Qué distribución de esta lección es la que obtiene, y qué habría salido si hubiera enchufado la media posterior?
- §8.3 The Gamma Distribution elige una Gamma como prior. ¿Qué parte de la Proposición 20.6 dejaría de funcionar con un prior que no fuera Gamma, y qué habría que hacer en su lugar?
Para el Cerebro
Nota nueva en 10-Conceptos/distribucion-predictiva.md, enlazada a [[priors-conjugados]], [[varianza-total]] y [[calibracion]]. Conviene rehacer a mano el Corolario 20.8: las dos razones de varianza salen de la misma descomposición y explican de un tirón por qué los conteos reales están sobredispersos.
¿Qué es la distribución predictiva posterior?::La distribución del próximo dato, ∫p(x̃|θ)π(θ|x)dθ: vive en el espacio de los datos, no en el del parámetro
¿Qué es la predictiva previa?::Lo mismo integrando contra el prior; evaluada en los datos observados es la evidencia m(x)
¿Qué tipo de objeto es una predictiva?::Una mezcla de las distribuciones de muestreo, con pesos dados por el posterior
¿Cuál es la predictiva de un posterior Beta?::La Beta-binomial: C(ñ,j)·B(a+j, b+ñ−j)/B(a,b)
¿Cuál es la probabilidad del próximo éxito?::a/(a+b), la media del posterior; con prior uniforme, la regla de sucesión (k+1)/(n+2)
¿Cuál es la predictiva de un posterior Gamma con datos Poisson?::Una binomial negativa de parámetros a y p = b/(b+1)
¿Por qué los conteos reales rara vez son Poisson?::Porque la Poisson exige media constante; en cuanto la media varía se observa una mezcla, y las mezclas están sobredispersas
¿Cómo se parte la varianza predictiva?::E[Var(x̃|θ)] + Var(E[x̃|θ]): ruido del muestreo más incertidumbre sobre el parámetro
¿Qué ignora el estimador de enchufe?::El segundo sumando: trata la estimación como si fuera el valor verdadero
¿Cuánto se pierde exactamente?::Razón (a+b+ñ)/(a+b+1) en el caso Beta-binomial y (b+1)/b en el Poisson
¿Por qué el exceso crece con ñ?::Porque el mismo error sobre θ se paga en cada dato futuro que se predice
¿Qué le pasa a un intervalo de enchufe?::Sale más estrecho y cubre menos de lo que promete: el modelo queda sobreconfiado
Fuentes
Lo que esta página demuestra sola. Las Proposiciones 20.3, 20.4, 20.6 y 20.7 y los Corolarios 20.5 y 20.8 se demuestran aquí, a partir de las definiciones y de la descomposición de la varianza total de la lección 4. Las dos fórmulas cerradas se comprueban además contra la integral numérica de la Definición 20.2 con 200 001 puntos y diferencia máxima por debajo de 10^{-9}, y sus momentos contra las razones del Corolario 20.8. La cobertura se mide simulando 200 000 pares (\theta,\tilde{k}) con semilla fija. El visual se contrastó antes de publicarse contra las fórmulas cerradas en todo el rango de sus tres controles.
Lo que se usa de otras lecciones sin repetir. La conjugación Beta–binomial y Gamma–Poisson son las Proposiciones 19.5 y 19.9. La constante B(a,b) y la densidad Gamma son las Definiciones 19.4 y 19.8. La descomposición de la varianza total es la lección 4. La regla de sucesión apareció en la lección 18. La noción de pronóstico sobreconfiado es la lección 16.
Lo que se enuncia sin demostrar. El intercambio del orden de integración en la Proposición 20.3 se justifica por no negatividad y se usa sin enunciar el teorema que lo permite. La media y la varianza de la Beta se toman de la lección 19 sin rederivarlas. El límite del ejercicio 3 se propone, no se demuestra.
Lo que viene de los libros.
- Think Bayes 2e (Downey, CC BY-NC-SA 4.0), §7.6 General Mixtures — citada textualmente una frase. §7.5 Mixture y §8.6 Predicting the Rematch recorren el mismo material por el camino computacional; §8.3 The Gamma Distribution introduce el prior Gamma.
Lo que es mío, no del libro. El orden: la Proposición 20.3 primero y las dos fórmulas cerradas como casos suyos. El Corolario 20.8 con las dos razones exactas escritas y demostradas, que Think Bayes no plantea. Y la medición de cobertura de la sección 5, construida para poner un número al coste del enchufe en lugar de dejarlo como advertencia.
Índice de Think Bayes 2e verificado el 12-09-2026: 193 secciones de los capítulos 1 a 18 y 20.