Teorema de Bayes y actualización
Estadística · Lección 18
Objetivo
Al terminar esta lección se puede:
- Demostrar el teorema de Bayes a partir de la definición de probabilidad condicional, y la ley de probabilidad total que le da el denominador.
- Rellenar una tabla bayesiana —prior, verosimilitud, producto, posterior— y reconocer que la evidencia es solo la constante que hace sumar uno.
- Demostrar la forma de razón, \text{razón posterior} = \text{razón previa}\times\text{factor de Bayes}, y usarla para actualizar sin calcular la evidencia.
- Demostrar que actualizar dato a dato y actualizar de golpe dan el mismo posterior, y explicar con eso por qué una prueba muy buena sobre una enfermedad rara deja aun así más dudas que certezas.
De dónde viene
- Estadística 1 y 2: la distribución de una variable aleatoria y la diferencia entre el mecanismo y el resultado. Aquí la novedad es poner una distribución sobre el parámetro, no sobre los datos.
- Estadística 8: la verosimilitud L(\theta) —la probabilidad de los datos observados leída como función del parámetro— es exactamente el factor que multiplica al prior. Máxima verosimilitud se queda con su máximo; Bayes la usa entera.
- Estadística 10: el valor p responde «qué tan raros serían estos datos si H_0 fuera cierta»; esta lección responde la pregunta que casi todo el mundo quería hacer, «qué tan probable es H_0 dados estos datos», y muestra qué hace falta para poder responderla.
Para qué sirve después
- Lección 19: si el prior y la verosimilitud encajan, el posterior sale en forma cerrada y no hace falta ninguna rejilla; eso son los priors conjugados.
- Lección 20: integrar el posterior sobre el parámetro da la distribución predictiva, que es lo que se usa para apostar sobre el próximo dato.
- Lecciones 22 a 24: cuando el parámetro tiene muchas dimensiones, la rejilla de esta lección deja de caber y hay que muestrear el posterior en vez de calcularlo.
- Estadística 16: un posterior es un pronóstico probabilístico, y la calibración de la lección 16 es la forma de comprobar si es honesto.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| H, H_i | hache | Una hipótesis; H_1,\dots,H_k una lista exhaustiva y excluyente de ellas |
| D | de | Los datos observados |
| P(H) | pe de hache | El prior: la creencia antes de ver D |
| P(D\mid H) | pe de de dado hache | La verosimilitud: qué tan probables eran los datos bajo esa hipótesis |
| P(D) | pe de de | La evidencia o constante normalizadora |
| P(H\mid D) | pe de hache dado de | El posterior: la creencia después de ver D |
| \text{o}(H) | razón de hache | La razón P(H)/P(\lnot H), que convierte probabilidades en momios |
1. De la definición de condicional al teorema
Definición 18.1 (probabilidad condicional). Para sucesos A y B con P(B)>0, P(A\mid B) = \frac{P(A\cap B)}{P(B)}. Se lee: de todo el espacio en que B ocurre, qué fracción tiene también A.
Proposición 18.2 (teorema de Bayes). Si P(D)>0 y P(H)>0, P(H\mid D) = \frac{P(D\mid H)\,P(H)}{P(D)}.
Demostración. Por la Definición 18.1 aplicada dos veces al mismo suceso H\cap D, una condicionando en D y otra en H: P(H\mid D)\,P(D) = P(H\cap D) = P(D\mid H)\,P(H). Dividiendo entre P(D)>0 queda el enunciado. ∎
La demostración cabe en dos líneas y aun así el resultado cambia qué preguntas se pueden responder: invierte el condicionamiento. La verosimilitud P(D\mid H) es lo que un modelo sabe calcular —dada la hipótesis, qué datos son probables—, y lo que se quiere es P(H\mid D). El teorema dice cuál es el precio de darle la vuelta: hay que tener P(H).
Proposición 18.3 (ley de probabilidad total). Si H_1,\dots,H_k son excluyentes entre sí y su unión es todo el espacio, entonces P(D) = \sum_{i=1}^{k} P(D\mid H_i)\,P(H_i).
Demostración. Los sucesos D\cap H_i son excluyentes y su unión es D, porque los H_i cubren todo el espacio. Por aditividad, P(D)=\sum_i P(D\cap H_i), y cada término se reescribe con la Definición 18.1 como P(D\mid H_i)P(H_i). ∎
Juntando las dos proposiciones, el denominador deja de ser un problema: se calcula sumando la columna del producto. Eso es todo lo que hay detrás de la tabla bayesiana.
Definición 18.4 (tabla bayesiana). Una fila por hipótesis y cuatro columnas: el prior P(H_i), la verosimilitud P(D\mid H_i), su producto, y el posterior, que es el producto dividido entre la suma de la columna del producto. La suma de esa columna es P(D).
El posterior del primer tazón sube de 0{,}5 a 0{,}6 porque ese tazón tiene más vainilla, y la subida es exactamente la que dicta la razón de verosimilitudes. La columna del producto suma 0{,}625, que es P(\text{vainilla}): la evidencia es solo lo que hace falta para que los posteriores sumen uno, y no un ingrediente que haya que conocer aparte.
2. La forma de razón: actualizar sin denominador
Cuando hay solo dos hipótesis, se puede evitar el denominador por completo, y de paso queda a la vista cuánto mueve cada dato a la creencia.
Proposición 18.5 (forma de razón). Para dos hipótesis H y \lnot H, \underbrace{\frac{P(H\mid D)}{P(\lnot H\mid D)}}_{\text{razón posterior}} \;=\; \underbrace{\frac{P(H)}{P(\lnot H)}}_{\text{razón previa}}\;\times\;\underbrace{\frac{P(D\mid H)}{P(D\mid \lnot H)}}_{\text{factor de Bayes}}.
Demostración. Escríbase la Proposición 18.2 para H y para \lnot H y divídase una entre otra: \frac{P(H\mid D)}{P(\lnot H\mid D)} = \frac{P(D\mid H)P(H)/P(D)}{P(D\mid \lnot H)P(\lnot H)/P(D)} = \frac{P(D\mid H)}{P(D\mid\lnot H)}\cdot\frac{P(H)}{P(\lnot H)}, donde P(D) se cancela por aparecer en los dos denominadores. ∎
El factor de Bayes es entonces la medida natural de cuánta evidencia trae un dato: no depende del prior, y multiplica. Un factor de 20 mueve una razón de 1 a 99 hasta 20 a 99, que sigue siendo poco más del 16 % —y ese es exactamente el cálculo de la sección siguiente—.
Proposición 18.6 (actualizar de golpe o de a poco es lo mismo). Sean D_1,\dots,D_n datos condicionalmente independientes dada cada hipótesis, es decir P(D_1,\dots,D_n\mid H)=\prod_j P(D_j\mid H). Entonces actualizar una observación a la vez —usando cada posterior como prior de la siguiente— da el mismo resultado que actualizar con las n de golpe, y el orden en que se procesen no importa.
Demostración. Por inducción. Tras la primera observación, P(H\mid D_1)\propto P(D_1\mid H)P(H). Si tras j observaciones se tiene P(H\mid D_1,\dots,D_j)\propto P(H)\prod_{l\le j}P(D_l\mid H), entonces usar ese posterior como prior y multiplicar por P(D_{j+1}\mid H) da P(H\mid D_1,\dots,D_{j+1}) \;\propto\; P(H)\prod_{l\le j+1}P(D_l\mid H), que es la actualización de golpe con las j+1 observaciones. El símbolo \propto oculta solo la constante que hace sumar uno, y normalizar al final o en cada paso da lo mismo. Como el producto de la derecha no depende del orden de los factores, tampoco lo hace el posterior. ∎
Esta proposición es la que permite tratar los datos como un flujo, y la que hace que un modelo bayesiano no necesite recordar los datos viejos: le basta con su posterior actual.
3. Una prueba muy buena sobre algo muy raro
Con las tres proposiciones anteriores se puede resolver el caso que más confusión produce en la práctica.
Una prueba con 99 % de sensibilidad y 95 % de especificidad, aplicada a una enfermedad que tiene una persona de cada cien, deja la probabilidad de estar enfermo tras un positivo en 16,7 %. No hay ningún error en la prueba: hay noventa y nueve veces más sanos que enfermos, y el 5 % de un grupo noventa y nueve veces mayor produce cinco veces más falsos positivos que verdaderos positivos hay. En frecuencias naturales sobre diez mil personas: 99 positivos enfermos frente a 495 positivos sanos.
Dos lecturas que conviene separar. La primera, que el resultado sí es informativo: la creencia pasó del 1 % al 16,7 %, que es multiplicarla por casi diecisiete —el factor de Bayes de la Proposición 18.5 vale 0{,}99/0{,}05 = 19{,}8—. La segunda, que un segundo positivo independiente la lleva al 79,8 %, porque la Proposición 18.6 permite encadenar: el posterior de la primera prueba es el prior de la segunda.
Este es el mismo error que la lección 10 persigue con otro disfraz. Confundir P(D\mid H_0) —el valor p, o aquí la tasa de falsos positivos— con P(H_0\mid D) es exactamente invertir el condicionamiento sin pagar el precio que la Proposición 18.2 exige: el prior. Sin prevalencia no hay respuesta posible, y esa es la diferencia irreducible entre los dos enfoques.
4. Actualizar sobre un parámetro continuo
Nada de lo anterior exige que las hipótesis sean unas pocas. Si el parámetro es continuo, se pone una rejilla suficientemente fina, el prior es un vector sobre ella y cada actualización es una multiplicación seguida de una normalización.
Los tres caminos —una a una en un orden, una a una en el orden inverso, y las doce de golpe con la verosimilitud binomial— dan el mismo posterior con diferencia máxima de 3\times10^{-18}: la Proposición 18.6, medida. Y la media del posterior sale 9/14, que es (k+1)/(n+2): con prior uniforme, la media posterior es la proporción observada corregida con un éxito y un fracaso imaginarios. El máximo, en cambio, cae en k/n, que es el estimador de máxima verosimilitud de la lección 8. Las dos resúmenes del mismo posterior no coinciden, y hay que decir cuál se está usando.
Ejercicios
Ejercicio 1 — Monty Hall con la tabla
El concursante elige la puerta 1 y el presentador —que sabe dónde está el premio y nunca lo abre— abre la puerta 3, que tiene cabra. Rellenar la tabla bayesiana y contrastarla con una simulación. La clave está en la verosimilitud: si el premio estuviera en la 1, el presentador podía abrir la 2 o la 3 y eligió una; si estuviera en la 2, estaba obligado a abrir la 3.
La tabla da 2/3 para cambiar de puerta y la simulación de 200 000 partidas da 0{,}6652. Toda la asimetría vive en la columna de verosimilitudes: con el premio en la 2 el presentador no tenía elección, y esa obligación es la información que el concursante recibe.
Ejercicio 2 — Cuántos positivos hacen falta
Con la forma de razón de la Proposición 18.5, actualizar k pruebas independientes es multiplicar la razón previa por el factor de Bayes k veces. Calcular cuántos positivos hacen falta para pasar del 95 % de probabilidad con una enfermedad de prevalencia 1 por mil, y comparar dos pruebas que difieren solo en la especificidad.
Con prevalencia de uno por mil hacen falta cuatro positivos para superar el 95 %, y con una prueba de 99 % de especificidad bastan tres. La cuenta se hace multiplicando razones, sin calcular la evidencia ni una sola vez.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 18:
- Escribir
tabla_bayesiana(prior, verosimilitud)que devuelva el posterior y la evidencia, yactualizar(posterior, verosimilitud)para encadenar. Probar que encadenar n actualizaciones coincide con una sola actualización con el producto de verosimilitudes, a tolerancia 10^{-12}, sobre cien casos aleatorios. - Reproducir el problema de los 101 tazones de Think Bayes §3.4: hay 101 tazones con proporciones de vainilla 0, 0{,}01, \dots, 1, se elige uno al azar y se sacan galletas con reemplazo. Graficar cómo evoluciona el posterior sobre el índice del tazón tras cada galleta, y comparar con la rejilla de la sección 4 de esta lección.
- Implementar la actualización en logaritmos —sumar log-verosimilitudes en vez de multiplicar verosimilitudes— y encontrar un caso con muchos datos donde la versión directa dé cero por underflow y la logarítmica no. Es el mismo argumento de la lección 8 y la razón por la que todo el software bayesiano trabaja en log.
Del libro
Think Bayes se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.
The Bayes table is a useful tool for solving problems like this.
Downey, Think Bayes 2e, §2.3 Bayes Tables
El libro llega a la misma tabla de la Definición 18.4 y la usa como herramienta principal durante los tres primeros capítulos. La diferencia de camino es de énfasis: Think Bayes trabaja siempre con objetos Pmf de su propia librería y evita las fórmulas, mientras que esta página demuestra primero las tres proposiciones y después escribe la tabla como su consecuencia.
Preguntas para leer §1 a §3 con lápiz:
- §1.1 Linda the Banker presenta la falacia de la conjunción. ¿Qué desigualdad elemental sobre P(A\cap B) la convierte en un error de aritmética y no de opinión?
- §2.2 Diachronic Bayes llama «diacrónica» a la interpretación de actualizar creencias con el tiempo. ¿Qué proposición de esta lección es la que garantiza que ese proceso por pasos no dependa del orden?
- §3.4 101 Bowls resuelve con 101 hipótesis el mismo problema que §2.1 resuelve con dos. ¿En qué momento deja de tener sentido enumerar hipótesis y hay que pasar a una rejilla, y qué se pierde al hacerlo?
Para el Cerebro
Nota nueva en 10-Conceptos/teorema-de-bayes.md, enlazada a [[verosimilitud]], [[valor-p]] y [[probabilidad-condicional]]. Conviene rehacer a mano la Proposición 18.5: sale de dividir dos veces el mismo teorema y deja el factor de Bayes como la medida limpia de cuánta evidencia trae un dato.
¿Qué dice el teorema de Bayes?::P(H|D) = P(D|H)·P(H)/P(D): invierte el condicionamiento, a cambio de exigir un prior
¿Cómo se demuestra?::Escribiendo P(H∩D) de las dos maneras que permite la definición de condicional
¿Qué es la evidencia P(D)?::La suma de la columna del producto: la constante que hace que los posteriores sumen uno
¿Qué es la ley de probabilidad total?::P(D) = Σ P(D|Hᵢ)P(Hᵢ) sobre una partición de hipótesis
¿Qué cuatro columnas tiene una tabla bayesiana?::Prior, verosimilitud, producto y posterior
¿Cuál es la forma de razón?::razón posterior = razón previa × factor de Bayes, sin calcular la evidencia
¿Qué es el factor de Bayes?::P(D|H)/P(D|¬H): cuánta evidencia trae el dato, independientemente del prior
¿Da lo mismo actualizar de a poco que de golpe?::Sí, si los datos son condicionalmente independientes; y el orden tampoco importa
¿Por qué un positivo en una prueba muy buena puede dejar poca certeza?::Porque con prevalencia baja hay muchísimos más sanos, y su pequeño porcentaje de falsos positivos supera a los verdaderos
¿Qué diferencia hay entre P(D|H₀) y P(H₀|D)?::La primera es el valor p; la segunda necesita un prior, y confundirlas es invertir el condicionamiento sin pagarlo
¿Cuál es la media del posterior con prior uniforme y k caras de n?::(k+1)/(n+2), la regla de sucesión; el máximo, en cambio, cae en k/n
Fuentes
Lo que esta página demuestra sola. Las Proposiciones 18.2, 18.3, 18.5 y 18.6 se demuestran aquí, a partir únicamente de la Definición 18.1 y de la aditividad de la probabilidad. Se comprueban además numéricamente: la tabla del problema de los tazones contra el valor exacto 3/5; la prueba diagnóstica contra su fórmula cerrada y contra el recuento en frecuencias naturales; la equivalencia entre actualizar en dos órdenes distintos y de golpe, con diferencia máxima 3\times10^{-18}; la media del posterior contra (k+1)/(n+2); y Monty Hall contra una simulación de 200 000 partidas. Los dos visuales se contrastaron antes de publicarse: 300 prevalencias × 51 sensibilidades × 51 especificidades para el primero, y 3 priors × la sucesión de actualizaciones para el segundo.
Lo que se usa de otras lecciones sin repetir. La verosimilitud como función del parámetro es la lección 8. La distinción entre P(D\mid H_0) y P(H_0\mid D) arranca en la lección 10. La lectura de un posterior como pronóstico probabilístico es la lección 16.
Lo que se enuncia sin demostrar. Nada. La independencia condicional de la Proposición 18.6 es una hipótesis del enunciado, no un hecho: cuando falla —datos correlacionados— encadenar actualizaciones cuenta la misma evidencia dos veces, y eso queda advertido en la propia proposición.
Lo que viene de los libros.
- Think Bayes 2e (Downey, CC BY-NC-SA 4.0), §2.3 Bayes Tables — citada textualmente una frase. Los capítulos §1 Probability, §2 Bayes’s Theorem y §3 Distributions cubren el mismo material por el camino computacional.
Lo que es mío, no del libro. La numeración y el orden: definición de condicional → teorema → ley total → tabla, con la tabla como consecuencia y no como punto de partida. La Proposición 18.6 enunciada y demostrada por inducción —Think Bayes la usa constantemente sin enunciarla—, y el tratamiento del caso diagnóstico con la forma de razón, que evita el denominador y deja el factor de Bayes a la vista.
Índice de Think Bayes 2e ampliado y verificado el 12-09-2026: 193 secciones de los capítulos 1 a 18 y 20.