Comparación de modelos

Estadística · Lección 21

L2 Derivación Fase F5 Libro Think Bayes 2e §10 · §6 Prereqs Distribuciones predictivas · Pruebas de hipótesis

Objetivo

Al terminar esta lección se puede:

  1. Definir la verosimilitud marginal de un modelo y el factor de Bayes entre dos, y demostrar la forma de razón que los conecta con las probabilidades posteriores de los modelos.
  2. Demostrar que la verosimilitud marginal se factoriza en un producto de probabilidades predictivas de un paso, y leer con eso el resultado como una puntuación de pronóstico y no como un ajuste.
  3. Demostrar la navaja de Occam automática: cada modelo reparte una unidad de masa entre todos los conjuntos de datos posibles, así que ninguno puede predecirlos todos bien.
  4. Demostrar que el factor de Bayes depende del prior dentro de cada modelo aunque los datos sean muchos, exhibir un caso donde el valor p rechaza y el factor de Bayes no, y decir qué se puede reportar a pesar de eso.

De dónde viene

  • Estadística 20: la predictiva previa. Evaluada en los datos que de verdad se observaron, es la verosimilitud marginal de esta lección. Los dos objetos son el mismo mirado desde distinto sitio.
  • Estadística 18: la forma de razón del teorema de Bayes. Aquí se aplica una planta más arriba: las hipótesis ya no son valores del parámetro sino modelos enteros.
  • Estadística 19: la Proposición 19.13 actualizaba los pesos de una mezcla con la verosimilitud marginal de cada componente. Comparar modelos es eso mismo con componentes que ya no comparten espacio de parámetros.
  • Estadística 10: el valor p. La sección 5 los enfrenta en un caso donde no dicen lo mismo, y explica por qué.

Para qué sirve después

  • Lección 22: la verosimilitud marginal es la integral que Metropolis-Hastings no necesita calcular, y esa es justamente la razón de que el método funcione donde la conjugación no llega.
  • Lección 24: comparar modelos con salidas de MCMC exige estimar esa integral, que es la parte difícil; conviene saber antes qué se está estimando.
  • Estadística 16: la factorización de la Proposición 21.4 convierte la verosimilitud marginal en una puntuación logarítmica acumulada, que es una regla propia en el sentido de la lección 16.
  • Estadística 17: la navaja de Occam del Corolario 21.6 es la contraparte bayesiana del problema de comparaciones múltiples: un modelo con más libertad paga por adelantado.

Notación

Símbolo Se lee Significado
M_1, M_2 eme uno, eme dos Dos modelos completos: verosimilitud y prior sobre sus parámetros
m_j(x) eme sub jota de equis La verosimilitud marginal del modelo M_j en los datos x
\text{BF}_{21} be efe dos uno El factor de Bayes de M_2 frente a M_1, m_2(x)/m_1(x)
x_{1:i-1} equis uno a i menos uno Los datos anteriores al i-ésimo
\mathcal{X} equis caligráfica El conjunto de todos los datos que se podrían haber observado
\tau_0 tau cero La precisión del prior dentro del modelo, 1/\sigma_0^2

1. La verosimilitud marginal de un modelo

Un modelo, aquí, consta de dos piezas: una verosimilitud y un prior sobre sus parámetros. Sin el prior no hay nada que integrar, y la cantidad que sigue no existe.

Definición 21.1 (verosimilitud marginal). La verosimilitud marginal del modelo M en los datos observados x es m_M(x)=\int p(x\mid\theta,M)\,\pi(\theta\mid M)\,d\theta .

Es la predictiva previa de la Definición 20.1 evaluada en los datos que realmente ocurrieron. Dicho en palabras: la probabilidad que el modelo le había asignado por adelantado a lo que pasó.

Definición 21.2 (factor de Bayes). Para dos modelos, \text{BF}_{21}=m_2(x)/m_1(x).

Proposición 21.3 (forma de razón para modelos). Si P(M_1) y P(M_2) son las probabilidades previas de los dos modelos, entonces \frac{P(M_2\mid x)}{P(M_1\mid x)}=\frac{P(M_2)}{P(M_1)}\times \text{BF}_{21}.

Demostración. Por el teorema de Bayes aplicado a los modelos como hipótesis, P(M_j\mid x)=P(x\mid M_j)P(M_j)/P(x). Dividiendo las dos expresiones, el denominador común P(x) se cancela, y P(x\mid M_j) es por definición m_j(x).

La estructura es idéntica a la Proposición 18.5, y el reparto de tareas también: el factor de Bayes es lo que dicen los datos, y la razón previa es lo que se creía antes. Lo que cambia al subir de planta es que ahora m_j(x) ya no es una probabilidad elemental sino una integral, y esa integral es donde vive toda la dificultad del resto de la lección.

2. Una puntuación de pronóstico disfrazada

La verosimilitud marginal parece una medida de ajuste. No lo es en el sentido habitual, y el resultado siguiente dice exactamente qué es.

Proposición 21.4 (factorización prequencial). Para datos x=(x_1,\dots,x_n) tomados en ese orden, m_M(x)=\prod_{i=1}^{n} p(x_i\mid x_{1:i-1},M), donde cada factor es la probabilidad predictiva del dato i-ésimo dados solo los anteriores. En particular \log m_M(x)=\sum_{i=1}^{n}\log p(x_i\mid x_{1:i-1},M).

Demostración. Es la regla de la cadena para la probabilidad conjunta bajo M, p(x_1,\dots,x_n\mid M)=\prod_{i=1}^{n}p(x_i\mid x_{1:i-1},M), junto con la identificación m_M(x)=p(x\mid M) de la Definición 21.1, y el hecho de que cada factor condicional es, por la Definición 20.2 aplicada al modelo con los primeros i-1 datos ya absorbidos, la predictiva posterior de x_i.

La demostración es corta y la consecuencia no. La verosimilitud marginal es la suma de los aciertos de un pronosticador que va prediciendo cada dato antes de verlo, con lo aprendido hasta ese momento. No hay ninguna manera de mirar los datos dos veces: cada x_i se predice sin usarse a sí mismo. Por eso no necesita una penalización añadida por número de parámetros, como la que llevan pegada los criterios de información: la penalización ya está dentro, en forma de pronósticos peores al principio mientras el modelo aprende.

El orden no cambia el total, porque el producto de la Proposición 21.4 es siempre la misma probabilidad conjunta. Lo que sí cambia es cuándo se paga: los primeros pronósticos son los malos, y un modelo con más libertad los tiene peores.

3. La navaja de Occam no hay que añadirla

Proposición 21.5 (cada modelo reparte una unidad). Sea \mathcal{X} el conjunto de todos los conjuntos de datos posibles de tamaño n. Para todo modelo M, \sum_{x\in\mathcal{X}} m_M(x)=1 . En consecuencia, si M asigna mucha masa a un conjunto de datos, necesariamente asigna poca al resto.

Demostración. Por la Proposición 20.3, m_M(\cdot) es la predictiva previa, y una predictiva es una distribución de probabilidad legítima sobre el espacio de los datos. Sumar sobre todo \mathcal{X} da uno.

Corolario 21.6 (navaja de Occam automática). Si \mathcal{X} es finito con |\mathcal{X}|=N, entonces \max_{x} m_M(x)\ge 1/N, con igualdad si y solo si m_M es uniforme sobre \mathcal{X}. Un modelo más flexible —uno cuya predictiva previa esté más repartida— tiene un máximo más bajo, y por tanto no puede ganarle a un modelo rígido en los datos que el rígido predecía bien.

Demostración. El máximo de N números no negativos que suman uno es al menos su media 1/N, y vale exactamente 1/N solo si todos son iguales. La segunda parte es la lectura de la Proposición 21.5: la masa es un recurso conservado, y gastarla en muchos conjuntos de datos deja menos para cada uno.

Aquí está el contenido entero de la navaja de Occam bayesiana, y no hay que postularla: sale de que las predictivas suman uno. Un modelo que puede explicar cualquier cosa ha tenido que repartir su unidad de masa entre todas esas cosas, y le queda poca para la que efectivamente ocurrió. No es una preferencia estética por lo simple; es aritmética de una distribución de probabilidad.

El modelo uniforme reparte su unidad exactamente por igual entre los nueve resultados: su máximo es 1/9=0{,}1111, la cota del Corolario 21.6 alcanzada con igualdad. Es el modelo que menos se compromete, y por eso el que menos puede ganar. El modelo rígido \theta=0{,}5 concentra 0{,}2734 en k=4, y ahí es imbatible; a cambio, en k=0 apuesta 0{,}0039 y pierde por goleada.

El visual siguiente muestra ese reparto. El eje vertical está fijo, de modo que un modelo muy concentrado se sale por arriba en vez de reescalar el marco.

Ejemplo 21.7 (el problema del euro). Se lanza una moneda 250 veces y salen 140 caras, una proporción de 0{,}56. El modelo M_1 dice \theta=0{,}5 exactamente; el modelo M_2 pone un prior uniforme sobre \theta. El factor de Bayes a favor de M_2 vale 0{,}477: la evidencia favorece ligeramente a la moneda justa, pese a que la proporción observada se aleja de 0{,}5. El modelo libre acertó en la dirección y aun así perdió, porque había repartido su masa por todo [0,1] para poder acertar.

La columna del factor de Bayes sube de 0{,}48 a 1{,}94 y vuelve a bajar. Sube porque un prior concentrado alrededor de 0{,}5 malgasta menos masa en valores absurdos de \theta; vuelve a bajar porque, concentrado de más, el modelo libre se parece tanto al rígido que deja de poder distinguirse de él. El máximo está cerca de \text{Beta}(50,50), que es la anchura que mejor apuesta por la desviación observada. Y ninguno de esos números es un hecho sobre la moneda: son hechos sobre los priors que se eligieron.

4. El prior no se diluye

Con muchos datos, el prior sobre \theta dentro de un modelo deja de importar para el posterior —eso es la Proposición 19.6— pero no deja de importar para el factor de Bayes. El resultado siguiente lo dice en el caso más limpio.

Proposición 21.8 (sensibilidad persistente). Sean x_1,\dots,x_n con x_i\mid\theta\sim\mathcal{N}(\theta,1/\tau) y \tau conocida. Sea M_1 el modelo \theta=0 y M_2 el modelo \theta\sim\mathcal{N}(0,1/\tau_0). Entonces \text{BF}_{21}=\sqrt{\frac{\tau_0}{\tau_0+n\tau}}\;\exp\!\left(\frac{(n\tau\bar{x})^{2}}{2\tau_0(\tau_0+n\tau)}\cdot\frac{\tau_0}{n\tau}\right) \;=\;\sqrt{\frac{v_1}{v_2}}\,\exp\!\Big(\frac{\bar{x}^{2}}{2}\Big(\frac{1}{v_1}-\frac{1}{v_2}\Big)\Big), con v_1=1/(n\tau) y v_2=v_1+1/\tau_0. En particular, con los datos fijos, \text{BF}_{21}\to0 cuando \tau_0\to0.

Demostración. La verosimilitud se factoriza como p(x\mid\theta)=g(x)\,h(\bar{x}\mid\theta), donde g recoge la dispersión interna \sum_i(x_i-\bar{x})^2 y no depende de \theta; ese factor es común a los dos modelos y se cancela en el cociente. Bajo M_1, \bar{x}\sim\mathcal{N}(0,v_1). Bajo M_2, \bar{x}=\theta+\varepsilon con \theta\sim\mathcal{N}(0,1/\tau_0) y \varepsilon\sim\mathcal{N}(0,v_1) independientes, luego \bar{x}\sim\mathcal{N}(0,v_2) por suma de normales independientes. El cociente de las dos densidades normales evaluadas en \bar{x} da la segunda expresión, y la primera es la misma reescrita. Para el límite: cuando \tau_0\to0, v_2\to\infty, el factor \sqrt{v_1/v_2}\to0 y la exponencial tiende a la constante \exp(\bar{x}^2/(2v_1)). El producto tiende a cero.

Ejemplo 21.9 (el valor p y el factor de Bayes no dicen lo mismo). Con n=100, \tau=1 y \bar{x}=0{,}2, el estadístico es z=2{,}0 y el valor p de dos colas es 0{,}0455: significativo al 5 %. El factor de Bayes contra \theta=0 vale 1{,}34 con \tau_0=4, pero 0{,}0739 con \tau_0=0{,}01 y 7\times10^{-5} con \tau_0=10^{-8}. Con el mismo dato, un prior suficientemente vago sobre el efecto convierte la evidencia en favorable a que no hay efecto.

El comportamiento lo obliga la Proposición 21.5. Un prior más vago reparte la unidad de masa del modelo sobre un rango mayor de conjuntos de datos posibles, así que le toca menos al observado. El valor p no sufre lo mismo porque nunca preguntó qué masa había asignado nadie por adelantado; preguntó otra cosa, la de la lección 10.

El visual siguiente dibuja la dependencia entera en lugar de siete filas de tabla. El eje horizontal es la anchura del prior en escala logarítmica y está fijo; el vertical también, de modo que un factor de Bayes enorme se sale por arriba en vez de reescalar el marco.

5. Qué se puede reportar

De las cuatro secciones anteriores salen tres reglas prácticas, y ninguna es «usar el factor de Bayes sin más».

Primero: un factor de Bayes sin el prior que lo produjo no es una cantidad interpretable. La sección 4 muestra que se puede mover en cuatro órdenes de magnitud sin tocar los datos. Lo reportable es la curva del factor de Bayes contra la anchura del prior, como la tabla de la sección 3, que dice de un vistazo si la conclusión depende o no de esa elección.

Segundo: cuando la conclusión sí depende, la Proposición 21.4 ofrece una salida. Como la verosimilitud marginal es una suma de log-pronósticos de un paso, se puede calcular la misma suma sobre datos que el modelo no vio, y esa versión no arrastra el problema porque no se evalúa en el mismo sitio donde se eligió el prior. Es la puntuación logarítmica de la lección 16, aplicada a modelos en lugar de a pronósticos.

Tercero: la comparación solo tiene sentido entre modelos que se pusieron sobre la mesa antes de mirar. Elegir el modelo M_2 después de ver que \bar{x} salió positivo es el mismo error de la lección 17 con otro traje, y la aritmética de la Proposición 21.5 no protege de él: protege del exceso de flexibilidad declarada, no de la que se ejerce a escondidas.

Ejercicios

  1. Demostrar que \text{BF}_{12}=1/\text{BF}_{21} y que para tres modelos \text{BF}_{31}=\text{BF}_{32}\cdot\text{BF}_{21}. Deducir que los factores de Bayes definen un orden completo entre modelos y que las probabilidades posteriores se recuperan de ellos y de las previas.
  2. Comprobar en la Proposición 21.4 que reordenar los datos no cambia el producto, y explicar por qué eso implica que la verosimilitud marginal no distingue entre un modelo que aprende rápido y uno que aprende despacio si ambos acaban en el mismo sitio.
  3. Con n=8, calcular el reparto de masa del modelo \theta\sim\text{Beta}(a,a) para a=1,5,20,100 y comprobar en cada caso la cota del Corolario 21.6. ¿Para qué a se acerca más el reparto al del modelo \theta=0{,}5, y por qué eso hace inútil la comparación?
  4. En la Proposición 21.8, encontrar el \tau_0 que maximiza \text{BF}_{21} para \bar{x} y n dados, y comprobar que coincide con el máximo numérico de la tabla del Ejemplo 21.9. Interpretar ese valor como «la anchura de prior que mejor apuesta por lo observado».
  5. Construir dos modelos con la misma verosimilitud marginal en unos datos concretos pero predictivas previas muy distintas, y decir qué información se pierde al resumir un modelo por un solo número.

Reto

En proyectos/notebooks/F1-retos.ipynb, sección Est 21:

  1. Escribir log_marginal_beta(a, b, k, n) y bayes_factor(modelo1, modelo2, datos) trabajando siempre en logaritmos. Verificar la Proposición 21.4 calculando la marginal de las dos maneras —de golpe y como suma de log-pronósticos de un paso— sobre cien secuencias aleatorias, a tolerancia 10^{-10}.
  2. Reproducir la tabla del Ejemplo 21.7 y extenderla a una curva continua de \text{BF}_{21} contra \log a. Localizar el máximo numéricamente y compararlo con la solución analítica del ejercicio 4.
  3. Medir el coste de elegir el modelo después de mirar: simular mil experimentos con \theta=0{,}5 de verdad, en cada uno elegir el prior de M_2 centrado en la proporción observada, y ver con qué frecuencia el factor de Bayes «encuentra» un efecto que no existe. Comparar con la frecuencia cuando el prior se fija de antemano.

Del libro

Think Bayes se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.

The Bayes factor is the ratio of the likelihoods, which is a measure of the strength of the evidence.

Downey, Think Bayes 2e, §10.2 Evidence

El libro plantea el problema del euro en §10 y llega al mismo resultado incómodo: con 140 caras de 250, la evidencia no desmiente la moneda justa. Lo resuelve cambiando el prior de M_2 y mostrando cómo se mueve la conclusión, que es exactamente la tabla de la sección 3 de esta página. Aquí se añade la razón estructural —la Proposición 21.5— y el caso normal de la sección 4, que el libro no trata.

Preguntas para leer §10 y §6 con lápiz:

  1. §10.2 Evidence calcula la evidencia a favor de una hipótesis sobre otra. ¿En qué se diferencia esa cantidad de la verosimilitud máxima de la lección 8, y por qué la máxima no serviría para comparar modelos de distinta flexibilidad?
  2. §10.3 Uniformly Distributed Bias elige el prior uniforme para el modelo libre. ¿Qué número de la sección 3 de esta página es el que ese prior produce, y qué habría cambiado con un prior concentrado?
  3. §6.3 Oliver’s Blood presenta un caso en que la evidencia va en contra de la intuición. ¿Qué tiene en común con el problema del euro, y cuál de las proposiciones de esta lección explica los dos a la vez?

Para el Cerebro

Nota nueva en 10-Conceptos/comparacion-de-modelos.md, enlazada a [[distribucion-predictiva]], [[factor-de-bayes]] y [[valor-p]]. Conviene rehacer a mano la Proposición 21.5: es una línea, y de ella sale la navaja de Occam entera sin postular nada.

¿Qué es la verosimilitud marginal de un modelo?::La probabilidad que el modelo había asignado por adelantado a los datos que ocurrieron: la predictiva previa evaluada en ellos
¿Qué es un modelo, a estos efectos?::Una verosimilitud y un prior sobre sus parámetros; sin el prior no hay nada que integrar
¿Qué es el factor de Bayes?::El cociente de las dos verosimilitudes marginales, m₂(x)/m₁(x)
¿Cómo se combinan con lo que se creía antes?::razón posterior de modelos = razón previa × factor de Bayes
¿Cómo se factoriza la verosimilitud marginal?::Como producto de las predictivas de un paso: cada dato se predice sin usarse a sí mismo
¿Por qué no hace falta penalizar por parámetros?::Porque la penalización ya está dentro: un modelo más libre pronostica peor mientras aprende
¿Cuánto suma la marginal sobre todos los datos posibles?::Uno, para todo modelo; es una predictiva y las predictivas son distribuciones
¿De dónde sale la navaja de Occam bayesiana?::De ahí: la masa es un recurso conservado, y repartirla entre muchos datasets deja menos para el observado
¿Cuál es la cota del máximo con N resultados posibles?::Al menos 1/N, con igualdad solo si el reparto es uniforme
¿Qué pasó en el problema del euro?::140 de 250 y el factor de Bayes dio 0,477: la evidencia favorece a la moneda justa
¿El prior de dentro del modelo se diluye con n?::Para el posterior sí; para el factor de Bayes no: aplanarlo lo manda a cero
¿Qué hay que reportar entonces?::La curva del factor de Bayes contra la anchura del prior, no un solo número

Fuentes

Lo que esta página demuestra sola. Las Proposiciones 21.3, 21.4, 21.5 y 21.8 y el Corolario 21.6 se demuestran aquí, a partir del teorema de Bayes, de la regla de la cadena y de que una predictiva es una distribución (Proposición 20.3). Se comprueban además numéricamente: la factorización prequencial contra la integral cerrada, con diferencia por debajo de 10^{-10} y con los datos barajados tres veces; el reparto de masa de tres modelos sobre los nueve resultados de n=8, que suma uno en los tres casos y alcanza la cota 1/9 con igualdad en el modelo uniforme; la tabla del euro; y el límite de la Proposición 21.8 al aplanar el prior. El visual se contrastó antes de publicarse contra las fórmulas cerradas en todo el rango de sus tres controles.

Lo que se usa de otras lecciones sin repetir. La predictiva previa y su carácter de distribución son la lección 20. La forma de razón es la Proposición 18.5. La conjugación Beta–binomial y la suma de normales independientes son las lecciones 19 y 12. El valor p del Ejemplo 21.9 es la lección 10. La puntuación logarítmica de la sección 5 es la lección 16.

Lo que se enuncia sin demostrar. La factorización de la verosimilitud normal en un factor de dispersión interna por otro que solo depende de \bar{x} se usa en la Proposición 21.8 sin desarrollarla: es la identidad \sum_i(x_i-\theta)^2=\sum_i(x_i-\bar{x})^2+n(\bar{x}-\theta)^2 ya empleada en la lección 19. La afirmación de la sección 5 sobre puntuaciones en datos no vistos se enuncia como recomendación y no se demuestra aquí.

Lo que viene de los libros.

  • Think Bayes 2e (Downey, CC BY-NC-SA 4.0), §10.2 Evidence — citada textualmente una frase. §10.1 Estimation, §10.3 Uniformly Distributed Bias y §10.4 Bayesian Hypothesis Testing plantean el problema del euro; §6.3 Oliver’s Blood es el otro caso de evidencia contraintuitiva.

Lo que es mío, no del libro. La Proposición 21.4 enunciada y demostrada, y la lectura de la verosimilitud marginal como puntuación de pronóstico que sigue de ella. La Proposición 21.5 y el Corolario 21.6 como origen de la navaja de Occam, con la cota 1/N alcanzada con igualdad. La Proposición 21.8 y el Ejemplo 21.9, que enfrentan valor p y factor de Bayes sobre el mismo dato: Think Bayes no plantea ese contraste. Y las tres reglas de la sección 5.

Índice de Think Bayes 2e verificado el 12-09-2026: 193 secciones de los capítulos 1 a 18 y 20.