Priors conjugados
Estadística · Lección 19
Objetivo
Al terminar esta lección se puede:
- Demostrar que dos densidades proporcionales son iguales, y usar ese hecho para actualizar un prior reconociendo el núcleo de una densidad sin calcular nunca la evidencia.
- Demostrar las tres conjugaciones que se usan en la práctica: Beta–binomial, Gamma–Poisson y normal–normal con varianza conocida.
- Leer los parámetros de un prior conjugado como datos ficticios, y escribir la media posterior como promedio ponderado entre la media previa y el estimador de máxima verosimilitud.
- Demostrar que una mezcla finita de priors conjugados sigue siendo cerrada bajo actualización, y con eso reconocer qué se pierde al aceptar la familia: una creencia bimodal y una unimodal con la misma media dan posteriores distintos.
De dónde viene
- Estadística 18: el teorema de Bayes y la actualización secuencial. Allí el posterior se calculaba con una tabla o una rejilla; aquí se calcula en forma cerrada, y la tabla se vuelve innecesaria.
- Estadística 8: la verosimilitud como función del parámetro. La conjugación no dice nada sobre el prior en abstracto: es una propiedad del par prior–verosimilitud, y es la forma de la verosimilitud la que decide qué familia sirve.
- Estadística 3: la Beta, la Gamma y la Poisson como densidades concretas. Aquí dejan de ser modelos de datos y pasan a ser modelos de creencia sobre un parámetro.
- Estadística 12: completar el cuadrado en el exponente de una normal es la misma cuenta que allí da la condicional de una normal multivariante.
Para qué sirve después
- Lección 20: la distribución predictiva se obtiene integrando la verosimilitud contra el posterior; con un posterior conjugado esa integral también sale cerrada, y da la Beta-binomial y la binomial negativa.
- Lección 21: la verosimilitud marginal m(x) que aparece en la Proposición 19.12 es exactamente lo que compara dos modelos.
- Lecciones 22 y 23: los métodos de Monte Carlo existen para los casos en que no hay conjugación. Conviene conocer antes los casos en que sí la hay, porque sirven de patrón de comparación con respuesta exacta.
- Estadística 16: el pseudoconteo de la Proposición 19.6 es la forma más limpia de regularizar una proporción estimada con pocos datos antes de calibrarla.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| \theta | theta | El parámetro desconocido; aquí es aleatorio, no una constante |
| \pi(\theta) | pi de theta | La densidad del prior |
| \pi(\theta\mid x) | pi de theta dado equis | La densidad del posterior |
| p(x\mid\theta) | pe de equis dado theta | La verosimilitud, como función de \theta con x fijo |
| m(x) | eme de equis | La verosimilitud marginal \int p(x\mid\theta)\,\pi(\theta)\,d\theta |
| \propto | proporcional a | Igual salvo un factor que no depende de \theta |
| B(a,b) | be de a be | La función Beta, \int_0^1 t^{a-1}(1-t)^{b-1}dt |
| \text{Beta}(a,b) | beta de a be | La distribución sobre [0,1] con densidad \propto\theta^{a-1}(1-\theta)^{b-1} |
| \text{Gamma}(a,b) | gamma de a be | La distribución sobre (0,\infty) con forma a y tasa b |
| \tau | tau | La precisión, 1/\sigma^2 |
Un aviso sobre la Gamma: se parametriza de dos maneras incompatibles, por tasa b o por escala 1/b, y las dos se escriben igual. En esta lección b es siempre la tasa, de modo que la media es a/b. numpy.random.gamma usa la escala; en las celdas aparece por eso como 1/b.
1. El núcleo basta
La forma de densidades del teorema de Bayes se escribe
\pi(\theta\mid x) = \frac{p(x\mid\theta)\,\pi(\theta)}{m(x)},\qquad m(x)=\int p(x\mid\theta)\,\pi(\theta)\,d\theta .
El denominador no depende de \theta: una vez observados los datos es un número. Toda la dependencia en \theta está en el numerador, y eso permite trabajar con proporcionalidad, que es lo que hace corta cada demostración de esta lección.
Definición 19.1 (núcleo de una densidad). El núcleo de una densidad f(\theta) es cualquier función g tal que f(\theta)=c\,g(\theta) para alguna constante c>0 que no depende de \theta. Es decir, la densidad sin su constante de normalización.
Proposición 19.2 (el núcleo determina la densidad). Si f_1 y f_2 son densidades de probabilidad sobre el mismo conjunto \Theta y existe c>0 con f_1(\theta)=c\,f_2(\theta) para todo \theta, entonces c=1 y f_1=f_2.
Demostración. Integrando la igualdad sobre \Theta y usando que ambas son densidades, 1=\int_\Theta f_1 = c\int_\Theta f_2 = c\cdot 1 = c . Luego c=1 y por tanto f_1=f_2. ∎
El resultado es elemental y es el motor de todo lo que sigue. Permite el siguiente procedimiento: se multiplica prior por verosimilitud, se descartan todos los factores que no contengan \theta, y si lo que queda es el núcleo de una densidad conocida, esa es el posterior, con su constante ya determinada. La evidencia m(x) nunca se calcula.
Definición 19.3 (familia conjugada). Una familia \mathcal{F} de distribuciones sobre \theta es conjugada para la verosimilitud p(x\mid\theta) si para todo prior \pi\in\mathcal{F} y todo dato x el posterior \pi(\cdot\mid x) vuelve a estar en \mathcal{F}.
La conjugación es una propiedad del par, no del prior solo. La misma Beta es conjugada frente a una verosimilitud binomial y no lo es frente a una normal. Y la definición se cumple trivialmente si \mathcal{F} es el conjunto de todas las distribuciones: lo que la hace útil es que la familia esté descrita por pocos parámetros y que la actualización sea una regla aritmética sobre ellos.
2. Beta–binomial
Definición 19.4 (distribución Beta). Para a,b>0, la distribución \text{Beta}(a,b) tiene densidad sobre (0,1) \pi(\theta)=\frac{1}{B(a,b)}\,\theta^{a-1}(1-\theta)^{b-1},\qquad B(a,b)=\int_0^1 t^{a-1}(1-t)^{b-1}dt=\frac{\Gamma(a)\Gamma(b)}{\Gamma(a+b)} . Su media es a/(a+b). Con a=b=1 es la uniforme sobre (0,1).
Proposición 19.5 (conjugación Beta–binomial). Sea \theta\sim\text{Beta}(a,b) y sea k el número de éxitos en n ensayos independientes con probabilidad \theta cada uno. Entonces \theta\mid k \;\sim\; \text{Beta}(a+k,\; b+n-k).
Demostración. La verosimilitud es p(k\mid\theta)=\binom{n}{k}\theta^k(1-\theta)^{n-k}. Multiplicando por el prior y descartando todo lo que no depende de \theta —el coeficiente binomial y 1/B(a,b)—, \pi(\theta\mid k)\;\propto\;\theta^{k}(1-\theta)^{n-k}\cdot\theta^{a-1}(1-\theta)^{b-1}=\theta^{(a+k)-1}(1-\theta)^{(b+n-k)-1}. Lo de la derecha es el núcleo de una \text{Beta}(a+k,\,b+n-k) en el sentido de la Definición 19.1. Como el posterior es una densidad y esa Beta también, la Proposición 19.2 obliga a que sean la misma. ∎
La actualización se reduce a sumar: los éxitos al primer parámetro, los fracasos al segundo. Obsérvese que el coeficiente binomial desapareció, y con él toda dependencia del plan de muestreo: observar 7 éxitos de 10 ensayos fijos y observar 7 éxitos antes del tercer fracaso dan el mismo posterior, porque solo cambian en un factor que no contiene \theta.
Proposición 19.6 (la media posterior es un promedio ponderado). Con las hipótesis de la Proposición 19.5, E[\theta\mid k]=\frac{a+k}{a+b+n}=w\cdot\frac{a}{a+b}+(1-w)\cdot\frac{k}{n},\qquad w=\frac{a+b}{a+b+n}.
Demostración. La media de una \text{Beta}(\alpha,\beta) es \alpha/(\alpha+\beta); con \alpha=a+k y \beta=b+n-k la suma es a+b+n, lo que da la primera igualdad. Para la segunda, con w como en el enunciado, w\cdot\frac{a}{a+b}+(1-w)\cdot\frac{k}{n}=\frac{a+b}{a+b+n}\cdot\frac{a}{a+b}+\frac{n}{a+b+n}\cdot\frac{k}{n}=\frac{a}{a+b+n}+\frac{k}{a+b+n}, que es la primera expresión. ∎
De aquí sale la lectura que hace manejable la elección del prior: a y b se comportan como éxitos y fracasos ficticios observados antes de empezar, y a+b es el tamaño de esa muestra imaginaria. El peso del prior es w=(a+b)/(a+b+n), que tiende a cero cuando n crece: un prior fijo se diluye, y a la velocidad exacta que dicta el cociente. Con a=b=1 la media posterior es (k+1)/(n+2), la regla de sucesión que apareció en la lección 18.
Ejemplo 19.7. Prior \text{Beta}(2,2) —simétrico, media 0{,}5, equivalente a dos ensayos ficticios con un éxito y un fracaso— y datos k=7 de n=10. El posterior es \text{Beta}(9,5), de media 9/14=0{,}642857. La máxima verosimilitud daría 0{,}7 y el prior solo, 0{,}5; el peso del prior es 4/14=0{,}2857, y en efecto 0{,}2857\times0{,}5+0{,}7143\times0{,}7=0{,}642857.
La rejilla y la fórmula coinciden, como tienen que hacerlo: la Proposición 19.2 no deja alternativa. Lo que cambia es el coste, y por eso la conjugación importa más allá de la elegancia: la rejilla necesitó doscientos mil puntos y la fórmula, dos sumas.
El visual siguiente muestra las dos curvas sobre los mismos ejes. Los ejes no dependen de los datos: el horizontal es [0,1] porque \theta es una probabilidad, y el vertical está fijo, de modo que una densidad muy concentrada se sale por arriba en vez de reescalar el marco.
Conviene probar dos cosas en él. Con n=0 el posterior es el prior, como exige la fórmula. Y subiendo a y b juntos —de (2,2) a (20,20), misma media 0{,}5— el prior se estrecha y los mismos datos ya casi no lo mueven: el peso w pasó de 0{,}29 a 0{,}80.
3. Gamma–Poisson
Definición 19.8 (distribución Gamma). Para forma a>0 y tasa b>0, la densidad sobre (0,\infty) es \pi(\lambda)=\frac{b^{a}}{\Gamma(a)}\,\lambda^{a-1}e^{-b\lambda}, con media a/b y varianza a/b^2.
Proposición 19.9 (conjugación Gamma–Poisson). Sea \lambda\sim\text{Gamma}(a,b) y sean x_1,\dots,x_n independientes de Poisson con media \lambda dado \lambda. Entonces \lambda \mid x_1,\dots,x_n \;\sim\; \text{Gamma}\Big(a+\textstyle\sum_i x_i,\; b+n\Big).
Demostración. La verosimilitud conjunta es p(x\mid\lambda)=\prod_{i=1}^n \frac{\lambda^{x_i}e^{-\lambda}}{x_i!}\;\propto\;\lambda^{\sum_i x_i}e^{-n\lambda}, donde se descartó \prod_i x_i!, que no depende de \lambda. Multiplicando por el prior y volviendo a descartar constantes, \pi(\lambda\mid x)\;\propto\;\lambda^{\sum_i x_i}e^{-n\lambda}\cdot\lambda^{a-1}e^{-b\lambda} =\lambda^{(a+\sum_i x_i)-1}e^{-(b+n)\lambda}, que es el núcleo de una \text{Gamma}(a+\sum_i x_i,\,b+n). Por la Proposición 19.2, el posterior es esa Gamma. ∎
Corolario 19.10. Con las hipótesis anteriores, la media posterior es E[\lambda\mid x]=\frac{a+\sum_i x_i}{b+n}=w\cdot\frac{a}{b}+(1-w)\cdot\bar{x},\qquad w=\frac{b}{b+n}.
Demostración. La media de \text{Gamma}(\alpha,\beta) es \alpha/\beta, lo que da la primera igualdad. Para la segunda, escribiendo \sum_i x_i = n\bar{x}, \frac{b}{b+n}\cdot\frac{a}{b}+\frac{n}{b+n}\cdot\bar{x}=\frac{a}{b+n}+\frac{n\bar{x}}{b+n}=\frac{a+\sum_i x_i}{b+n}. ∎
La lectura como datos ficticios se repite con otro reparto: a hace de eventos imaginarios y b de tiempo de observación imaginario. Un prior \text{Gamma}(2,1) dice «he visto 2 eventos en 1 unidad de tiempo»: media 2, pero con muy poca convicción, porque una sola unidad de tiempo pesa poco frente a n.
4. Normal–normal con varianza conocida
Este es el caso donde la conjugación deja de ser una regla de sumar conteos y pasa a ser una regla de sumar precisiones, que es la forma en que la información se acumula en casi toda la estadística.
Definición 19.11 (precisión). La precisión de una distribución con varianza \sigma^2 es \tau=1/\sigma^2. Una precisión grande es una creencia concentrada.
Proposición 19.12 (conjugación normal–normal). Sea \theta\sim\mathcal{N}(\mu_0,\,1/\tau_0) y sean x_1,\dots,x_n independientes \mathcal{N}(\theta,\,1/\tau) dado \theta, con \tau conocida. Entonces \theta\mid x \;\sim\; \mathcal{N}\!\left(\frac{\tau_0\mu_0+n\tau\bar{x}}{\tau_0+n\tau},\;\frac{1}{\tau_0+n\tau}\right). En particular la precisión posterior es \tau_0+n\tau: las precisiones se suman, y la media posterior es el promedio de \mu_0 y \bar{x} ponderado por ellas.
Demostración. Descartando factores que no dependen de \theta, \pi(\theta\mid x)\;\propto\;\exp\Big(-\tfrac{\tau_0}{2}(\theta-\mu_0)^2\Big)\prod_{i=1}^n\exp\Big(-\tfrac{\tau}{2}(x_i-\theta)^2\Big) =\exp\Big(-\tfrac{1}{2}\big[\tau_0(\theta-\mu_0)^2+\tau\textstyle\sum_i(x_i-\theta)^2\big]\Big). Se descompone la suma alrededor de \bar{x} con la identidad \sum_i(x_i-\theta)^2=\sum_i(x_i-\bar{x})^2+n(\bar{x}-\theta)^2, y el primer sumando no depende de \theta, así que también se descarta. Queda el exponente -\tfrac{1}{2}\big[\tau_0(\theta-\mu_0)^2+n\tau(\theta-\bar{x})^2\big]. Escribiendo \tau_1=\tau_0+n\tau y desarrollando los cuadrados, el corchete vale \tau_1\theta^2-2(\tau_0\mu_0+n\tau\bar{x})\theta+\text{const}=\tau_1\Big(\theta-\frac{\tau_0\mu_0+n\tau\bar{x}}{\tau_1}\Big)^2+\text{const}, donde «const» reúne lo que no depende de \theta. Descartando de nuevo esa constante, \pi(\theta\mid x)\;\propto\;\exp\Big(-\tfrac{\tau_1}{2}\big(\theta-\mu_1\big)^2\Big),\qquad \mu_1=\frac{\tau_0\mu_0+n\tau\bar{x}}{\tau_1}, que es el núcleo de una normal de media \mu_1 y varianza 1/\tau_1. La Proposición 19.2 cierra el argumento. ∎
Completar el cuadrado es la misma cuenta que en la lección 12 da la condicional de una normal multivariante, y no es casualidad: allí se condiciona un bloque sobre otro y aquí se condiciona el parámetro sobre los datos, pero la estructura cuadrática del exponente es la misma.
Dos consecuencias que conviene tener a mano. La precisión posterior no depende de los datos, solo de n: antes de recoger nada ya se sabe cuán concentrado quedará el posterior. Y con \tau_0\to0 —prior cada vez más plano— la media posterior tiende a \bar{x} y la varianza a \sigma^2/n, que es exactamente el error estándar de la lección 7. El intervalo bayesiano y el frecuentista coinciden en ese límite, por caminos distintos.
Con un prior de precisión 10^{-6} la media posterior es \bar{x} y la desviación es \sigma/\sqrt{n}=1/3 hasta la sexta cifra. El visual siguiente deja mover las tres cantidades que entran en la fórmula.
Mover la media observada desplaza el posterior sin estrecharlo ni ensancharlo. Eso es la Proposición 19.12 a la vista: la precisión posterior es \tau_0+n\tau y ahí no aparece \bar{x} por ninguna parte.
5. Qué se gana y qué se pierde
Lo que se gana está a la vista: actualizar cuesta unas sumas, el posterior tiene media y varianza en forma cerrada, y los parámetros del prior admiten una lectura en unidades del problema. Lo que se pierde es más sutil, y la mejor manera de verlo es demostrar hasta dónde se puede estirar la familia.
Proposición 19.13 (las mezclas también son cerradas). Sea el prior una mezcla finita \pi(\theta)=\sum_{j=1}^{J} w_j\,\pi_j(\theta) con pesos w_j>0 que suman uno, donde cada \pi_j pertenece a una familia conjugada para p(x\mid\theta). Entonces el posterior es la mezcla \pi(\theta\mid x)=\sum_{j=1}^{J} w_j'\,\pi_j(\theta\mid x),\qquad w_j'=\frac{w_j\,m_j(x)}{\sum_{l} w_l\,m_l(x)}, donde \pi_j(\cdot\mid x) es el posterior que daría el componente j por separado y m_j(x)=\int p(x\mid\theta)\pi_j(\theta)d\theta es su verosimilitud marginal.
Demostración. Por definición de m_j, el componente j cumple p(x\mid\theta)\pi_j(\theta)=m_j(x)\,\pi_j(\theta\mid x). Multiplicando la mezcla por la verosimilitud y usando esa identidad término a término, p(x\mid\theta)\,\pi(\theta)=\sum_j w_j\,p(x\mid\theta)\,\pi_j(\theta)=\sum_j w_j\,m_j(x)\,\pi_j(\theta\mid x). Integrando en \theta, y como cada \pi_j(\cdot\mid x) integra uno, la constante de normalización es \sum_l w_l m_l(x). Dividiendo, queda la mezcla del enunciado con los pesos indicados. ∎
Los pesos se actualizan en proporción a lo bien que cada componente predijo los datos, que es la misma regla del teorema de Bayes una planta más arriba: ahora las «hipótesis» son los componentes. Esa m_j(x) es la cantidad con la que la lección 21 compara modelos enteros.
La proposición dice que la familia conjugada se puede ensanchar todo lo que haga falta —una mezcla de Betas aproxima cualquier densidad sobre [0,1]— a cambio de llevar J juegos de parámetros y J pesos. Pero si uno no la ensancha y se queda con un solo componente porque es cómodo, la forma del prior manda, y no solo su media.
Ejemplo 19.14. Dos priors con la misma media 0{,}5 y los mismos datos k=7 de n=10. El primero es \text{Beta}(5,5), unimodal. El segundo es la mezcla \tfrac12\text{Beta}(2,8)+\tfrac12\text{Beta}(8,2), bimodal: describe a alguien que cree que la moneda está cargada, pero no sabe hacia qué lado. El primero da media posterior 0{,}600; el segundo, 0{,}730, porque los datos casi apagan el componente bajo —su peso cae de 0{,}5 a 0{,}065— y dejan hablar al alto.
La conclusión práctica no es que las mezclas sean mejores, sino que elegir la familia es elegir una parte del prior, y esa parte no se ve en la media. Cuando la creencia real tiene dos modas y se la resume en una Beta por comodidad, se está afirmando algo que nadie creía.
Ejercicios
- Demostrar que si \theta\sim\text{Beta}(a,b) entonces 1-\theta\sim\text{Beta}(b,a), y deducir de ahí, sin cuentas nuevas, que intercambiar «éxito» por «fracaso» en la Proposición 19.5 da el posterior intercambiado.
- La varianza de una \text{Beta}(\alpha,\beta) es \alpha\beta/[(\alpha+\beta)^2(\alpha+\beta+1)]. Comprobar que con prior fijo y k/n fijo la varianza posterior es O(1/n), y que por tanto la desviación cae como 1/\sqrt{n}, igual que en la lección 7.
- Demostrar que la familia Gamma es conjugada también para la verosimilitud exponencial: si x_i\mid\lambda son exponenciales de tasa \lambda, el posterior es \text{Gamma}(a+n,\,b+\sum_i x_i). Comparar con la Proposición 19.9 y explicar por qué los papeles de n y de \sum_i x_i se intercambian.
- En la Proposición 19.12, tomar n=1 y aplicar el resultado dos veces seguidas con x_1 y luego x_2. Comprobar que se obtiene lo mismo que aplicarlo una vez con n=2, y decir qué proposición de la lección 18 es la que lo garantizaba de antemano.
- Construir una mezcla de dos Betas con media 0{,}5 cuyo posterior tras k=7 de n=10 tenga media menor que la del prior \text{Beta}(5,5), o demostrar que no existe.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 19:
- Escribir
actualiza_beta(a, b, k, n),actualiza_gamma(a, b, x)yactualiza_normal(mu0, tau0, x, tau)que devuelvan los parámetros del posterior. Verificar cada una contra una rejilla de al menos 10^5 puntos, comparando media y varianza a tolerancia 10^{-8}, sobre cien combinaciones aleatorias de parámetros. - Implementar la mezcla de la Proposición 19.13 para la verosimilitud binomial con J componentes arbitrario, trabajando en logaritmos para los pesos. Usarla para aproximar un prior que ponga masa en \theta\approx0{,}2 y en \theta\approx0{,}8 y reproducir el Ejemplo 19.14.
- Simular el pseudoconteo: generar mil monedas con \theta sorteado de \text{Beta}(2,2), observar n lanzamientos de cada una y comparar el error cuadrático medio de k/n contra el de la media posterior, para n=1,2,5,10,50. La media posterior debe ganar en los n pequeños; encontrar el n a partir del cual la diferencia deja de importar y explicarlo con el peso w de la Proposición 19.6.
Del libro
Think Bayes se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.
If the posterior distribution has the same form as the prior distribution, we call them conjugate distributions.
Downey, Think Bayes 2e, §18.2 The Conjugate Prior
El capítulo 18 llega a la conjugación al final del libro y por el camino contrario al de esta página: primero resuelve los problemas con rejillas durante diecisiete capítulos, y solo entonces enseña el atajo, con el énfasis puesto en comprobar que el atajo da lo mismo. Aquí el orden se invirtió porque la Proposición 19.2 hace la demostración más corta que la comprobación.
Preguntas para leer §18 y §4 con lápiz:
- §18.4 Binomial Likelihood deriva la conjugación Beta–binomial. ¿En qué punto del argumento se descarta el coeficiente binomial, y qué proposición de esta lección justifica que descartarlo no cambie nada?
- §18.6 The Dirichlet Distribution generaliza la Beta a más de dos categorías. ¿Qué papel juega allí el vector de conteos, y cómo se lee el pseudoconteo de la Proposición 19.6 en ese caso?
- §4.4 Triangle Prior usa un prior que no es Beta y por tanto no es conjugado. ¿Qué gana el libro al usarlo, y qué tendría que hacer para conservar esa forma con el método de esta lección?
Para el Cerebro
Nota nueva en 10-Conceptos/priors-conjugados.md, enlazada a [[teorema-de-bayes]], [[verosimilitud]] y [[distribucion-beta]]. Conviene rehacer a mano la Proposición 19.12: completar el cuadrado es la única de las tres demostraciones que no sale de mirar exponentes, y es la que reaparece en la lección 21.
¿Qué es una familia conjugada?::Una familia de priors tal que el posterior vuelve a caer en ella; es propiedad del par prior-verosimilitud, no del prior solo
¿Por qué basta reconocer el núcleo?::Porque dos densidades proporcionales son iguales: la constante queda determinada al integrar
¿Cuál es el posterior de Beta(a,b) con k de n?::Beta(a+k, b+n−k): se suman éxitos al primer parámetro y fracasos al segundo
¿Cómo se lee a+b en un prior Beta?::Como el tamaño de una muestra ficticia; el prior pesa (a+b)/(a+b+n)
¿Cuál es la media posterior Beta-binomial?::(a+k)/(a+b+n), promedio ponderado entre la media previa y k/n
¿Cuál es el posterior de Gamma(a,b) con datos Poisson?::Gamma(a+Σxᵢ, b+n): a cuenta eventos ficticios y b, tiempo ficticio
¿Qué se suma en el caso normal-normal?::Las precisiones: τ₁ = τ₀ + nτ, y la media posterior las usa como pesos
¿De qué no depende la precisión posterior?::De los datos; solo de n, así que se conoce antes de recogerlos
¿Qué pasa cuando la precisión del prior tiende a cero?::La media posterior tiende a x̄ y la desviación a σ/√n, el error estándar clásico
¿Qué hace el plan de muestreo en la conjugación Beta?::Nada: entra como factor constante y se descarta con el coeficiente binomial
¿Una mezcla de conjugados sigue siendo cerrada?::Sí, y los pesos se actualizan en proporción a la verosimilitud marginal de cada componente
¿Qué se pierde al elegir la familia por comodidad?::La forma del prior, que no se ve en la media: bimodal y unimodal con la misma media dan posteriores distintos
Fuentes
Lo que esta página demuestra sola. Las Proposiciones 19.2, 19.5, 19.6, 19.9, 19.12 y 19.13, y el Corolario 19.10, se demuestran aquí a partir de la forma de densidades del teorema de Bayes y de la definición de cada familia. Las tres conjugaciones se comprueban además numéricamente contra rejillas: Beta–binomial con 200 001 puntos y diferencia máxima por debajo de 10^{-9}; Gamma–Poisson y normal–normal con 400 001 puntos, comparando media y varianza a la misma tolerancia. El Ejemplo 19.14 se calcula por la fórmula de la Proposición 19.13. Los dos visuales se contrastaron antes de publicarse contra las fórmulas cerradas, barriendo los rangos completos de sus controles.
Lo que se usa de otras lecciones sin repetir. La verosimilitud como función del parámetro es la lección 8. La Beta, la Gamma y la Poisson son la lección 3. La actualización secuencial y su independencia del orden es la Proposición 18.6. Completar el cuadrado en un exponente cuadrático es la cuenta de la lección 12. El error estándar \sigma/\sqrt{n} es la lección 7.
Lo que se enuncia sin demostrar. La fórmula cerrada B(a,b)=\Gamma(a)\Gamma(b)/\Gamma(a+b) de la Definición 19.4 y las expresiones de media y varianza de la Beta y de la Gamma se usan sin demostrarlas: son integrales estándar y demostrarlas no aportaría nada al argumento de conjugación, que solo necesita reconocer núcleos. La afirmación de que una mezcla de Betas aproxima cualquier densidad sobre [0,1] se menciona como contexto y no se usa en ninguna demostración.
Lo que viene de los libros.
- Think Bayes 2e (Downey, CC BY-NC-SA 4.0), §18.2 The Conjugate Prior — citada textualmente una frase. §18.4 Binomial Likelihood y §18.6 The Dirichlet Distribution cubren la conjugación Beta–binomial y su generalización; §4 Estimating Proportions trata el mismo problema por rejilla.
Lo que es mío, no del libro. La Proposición 19.2 como punto de partida explícito, que convierte cada conjugación en un ejercicio de mirar exponentes. La lectura de los parámetros como pseudoconteo con el peso w escrito en forma cerrada (Proposición 19.6 y Corolario 19.10). La Proposición 19.13 sobre mezclas, enunciada y demostrada, y el Ejemplo 19.14 construido para que dos priors de idéntica media den posteriores separados por 0{,}13: Think Bayes no plantea esa comparación.
Índice de Think Bayes 2e verificado el 12-09-2026: 193 secciones de los capítulos 1 a 18 y 20.