Máxima verosimilitud: construir estimadores
Estadística · Lección 8
Objetivo
Al terminar esta lección se puede:
- Escribir la función de verosimilitud de una muestra y explicar por qué se lee como función del parámetro y no de los datos.
- Derivar el estimador de máxima verosimilitud de una proporción y de los dos parámetros de una normal.
- Demostrar que máxima verosimilitud elige el estimador sesgado de la varianza, y decir por qué eso no es un fallo del método.
- Reconocer que minimizar la suma de cuadrados es máxima verosimilitud bajo el supuesto de errores normales.
De dónde viene
- Lección 2: la función de masa y la función de densidad (Definiciones 2.1 y 2.5) son exactamente lo que se multiplica para formar la verosimilitud.
- Lección 4: la Proposición 4.10 demostró que s^2, con denominador n-1, es insesgada. Aquí se verá que máxima verosimilitud no la elige.
- Lección 7: allí se establecieron los criterios para juzgar un estimador —sesgo, ECM, consistencia— pero no un método para construir uno. Este es el método.
- Matemática 6: los mínimos cuadrados aparecieron como proyección ortogonal. La Proposición 8.9 los reencuentra por un camino distinto.
Para qué sirve después
- Lección 9: el intervalo de confianza se construye alrededor de un estimador; casi siempre el de máxima verosimilitud.
- Lección 10: la prueba de razón de verosimilitudes compara L bajo dos hipótesis, y es el patrón general de las pruebas.
- Lección 18: en el teorema de Bayes la verosimilitud es uno de los dos factores; la otra mitad es el prior. Esta lección es la mitad frecuentista de ese producto.
- Aprendizaje automático: la función de pérdida de la regresión logística es -\ell(\theta), y la entropía cruzada es la log-verosimilitud negativa de una categórica. Entrenar un modelo es, casi siempre, maximizar una verosimilitud.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| x_1,\dots,x_n | equis uno hasta equis ene | Los datos observados, fijos una vez recogidos |
| \theta | theta | El parámetro desconocido; puede ser un número o un vector |
| L(\theta) | ele de theta | Verosimilitud: probabilidad (o densidad) de los datos observados si el parámetro valiera \theta |
| \ell(\theta) | ele minúscula de theta | Log-verosimilitud, \log L(\theta) |
| \prod_{i=1}^{n} | productorio de uno a ene | Multiplica los n factores, como \sum los suma |
| \arg\max | argumento que maximiza | El valor de \theta donde se alcanza el máximo, no el máximo |
| \hat{\theta}_{\text{MV}} | theta sombrero de máxima verosimilitud | El estimador que define este método |
| Q | cu | La suma de cuadrados centrada, \sum_i (x_i - \bar{x})^2 |
Conviene separar dos cosas que se escriben casi igual. La función de densidad f(x;\theta) se lee como función de x con \theta fijo: describe qué datos son probables. La verosimilitud L(\theta) es la misma fórmula leída al revés —con los datos fijos y \theta variable— y no es una densidad en \theta: no integra uno y no dice que un valor de \theta sea más probable que otro. Dice que los datos observados serían más probables si el parámetro fuera ese.
1. La verosimilitud
Definición 8.1 (verosimilitud). Sea x_1,\dots,x_n una muestra i.i.d. de una distribución con función de masa o densidad f(x;\theta). La función de verosimilitud es L(\theta) = \prod_{i=1}^{n} f(x_i;\theta), considerada como función de \theta con los datos fijos.
El producto sale de la independencia: la Definición 2.9 dice que la probabilidad conjunta de sucesos independientes es el producto de las probabilidades. Si los datos no fueran independientes, la verosimilitud existiría igual, pero no se factorizaría así.
P(D|H) is the probability of the data under the hypothesis, called the likelihood.
Downey, Think Bayes 2e, §2.2 Diachronic Bayes
Es la misma cantidad. Downey la nombra dentro del teorema de Bayes, donde H es una hipótesis; aquí la hipótesis es «el parámetro vale \theta» y se la mira sola, sin prior. La lección 18 vuelve sobre este cruce.
Definición 8.2 (log-verosimilitud). \ell(\theta) = \log L(\theta) = \sum_{i=1}^{n} \log f(x_i;\theta).
Proposición 8.3. L y \ell alcanzan su máximo en el mismo \theta: \arg\max_\theta L(\theta) = \arg\max_\theta \ell(\theta).
Demostración. El logaritmo es estrictamente creciente en (0,\infty): si 0 < a < b entonces \log a < \log b. Sea \theta^{*} un maximizador de L y \theta cualquier otro valor. Entonces L(\theta) \le L(\theta^{*}), y aplicando \log a ambos lados —lo que conserva la desigualdad por ser creciente— resulta \ell(\theta) \le \ell(\theta^{*}). Luego \theta^{*} maximiza también \ell. El argumento se recorre igual en sentido contrario, porque \exp también es estrictamente creciente. ∎
Esto no es una comodidad menor. Con n = 200 datos, L es un producto de doscientos números menores que uno: en aritmética de punto flotante se vuelve cero por underflow mucho antes de que el cálculo termine. La suma de logaritmos no tiene ese problema. En la práctica siempre se maximiza \ell, nunca L.
El visual muestra L y \ell para una moneda. El interruptor cambia entre las dos curvas: el pico no se mueve.
Dos lecturas del visual. La primera: el cociente L(\hat{\theta})/L(\theta) crece deprisa al alejar \theta del pico, y crece mucho más deprisa con n grande —con la misma proporción de caras—. Eso es lo que significa que una muestra grande sea informativa: separa mejor hipótesis vecinas. La segunda: la curva de \ell es un simple arco cóncavo, y su pico está en el mismo sitio. Trabajar con logaritmos no cambia dónde está la respuesta, solo cómo se llega a ella.
2. El estimador de máxima verosimilitud
Definición 8.4 (estimador de máxima verosimilitud). \hat{\theta}_{\text{MV}} = \arg\max_{\theta} \ell(\theta). Es decir: el valor del parámetro bajo el cual los datos observados serían lo más probables posible.
Nótese qué clase de objeto es. \hat{\theta}_{\text{MV}} depende de la muestra, luego es una variable aleatoria y cae bajo todos los criterios de la lección 7: tiene sesgo, varianza, ECM y puede ser o no consistente. Máxima verosimilitud es una receta para fabricar estimadores; no promete nada sobre su calidad. Las secciones 3 y 5 muestran las dos caras de eso.
Proposición 8.5 (proporción). Sea x_1,\dots,x_n una muestra de una Bernoulli de parámetro \theta, con k = \sum_i x_i éxitos. Entonces \hat{\theta}_{\text{MV}} = \frac{k}{n} = \bar{x}.
Demostración. La función de masa es f(x;\theta) = \theta^{x}(1-\theta)^{1-x} para x \in \{0,1\}, y por tanto L(\theta) = \prod_{i=1}^{n} \theta^{x_i}(1-\theta)^{1-x_i} = \theta^{k}(1-\theta)^{n-k}, donde se han agrupado los exponentes usando \sum_i x_i = k. Tomando logaritmos, \ell(\theta) = k\log\theta + (n-k)\log(1-\theta). Derivando respecto a \theta e igualando a cero: \ell'(\theta) = \frac{k}{\theta} - \frac{n-k}{1-\theta} = 0 \;\Longrightarrow\; k(1-\theta) = (n-k)\theta \;\Longrightarrow\; k = n\theta. Luego \theta = k/n. Para confirmar que es un máximo y no un mínimo se deriva otra vez: \ell''(\theta) = -\frac{k}{\theta^2} - \frac{n-k}{(1-\theta)^2} < 0 para todo \theta \in (0,1) siempre que 0 < k < n, así que \ell es estrictamente cóncava y el punto crítico es el máximo global. ∎
El resultado es el esperado, y ese es justamente el interés: un método general, aplicado al caso más simple, devuelve lo que cualquiera habría hecho a ojo. Eso da confianza para usarlo donde la intuición no llega.
La segunda tabla es el argumento numérico de la Proposición 8.3: con n = 2000 el producto ya no es representable y vale exactamente cero, con lo que el máximo de L deja de existir para la máquina. La suma de logaritmos, en cambio, se queda en una escala perfectamente manejable.
3. La normal, y una sorpresa
La normal tiene dos parámetros, así que \theta = (\mu, \sigma) y hay que anular dos derivadas parciales.
Proposición 8.6 (normal). Sea x_1,\dots,x_n una muestra de una \mathcal{N}(\mu,\sigma^2). Entonces \hat{\mu}_{\text{MV}} = \bar{x}, \qquad \hat{\sigma}^2_{\text{MV}} = \frac{1}{n}\sum_{i=1}^{n}(x_i-\bar{x})^2 = \frac{Q}{n}.
Demostración. La densidad es f(x;\mu,\sigma) = \frac{1}{\sigma\sqrt{2\pi}}\exp\!\big(-\frac{(x-\mu)^2}{2\sigma^2}\big), de donde \ell(\mu,\sigma) = -n\log\sigma - \frac{1}{2\sigma^2}\sum_{i=1}^{n}(x_i-\mu)^2 - \frac{n}{2}\log(2\pi).
Primer parámetro. Solo el término central depende de \mu, y \sigma^2 > 0, así que maximizar en \mu equivale a minimizar \sum_i (x_i-\mu)^2. Derivando: \frac{\partial \ell}{\partial \mu} = \frac{1}{\sigma^2}\sum_{i=1}^{n}(x_i-\mu) = 0 \;\Longrightarrow\; \sum_i x_i = n\mu \;\Longrightarrow\; \mu = \bar{x}. La segunda derivada es -n/\sigma^2 < 0, luego es un máximo. Obsérvese que el valor obtenido no depende de \sigma: el maximizador en \mu es \bar{x} sea cual sea \sigma, y por eso las dos ecuaciones se pueden resolver en cadena en vez de a la vez.
Segundo parámetro. Sustituyendo \mu = \bar{x}, queda \ell(\bar{x},\sigma) = -n\log\sigma - \frac{Q}{2\sigma^2} - \frac{n}{2}\log(2\pi) con Q = \sum_i(x_i-\bar{x})^2. Derivando respecto a \sigma: \frac{\partial \ell}{\partial \sigma} = -\frac{n}{\sigma} + \frac{Q}{\sigma^{3}} = 0 \;\Longrightarrow\; \frac{Q}{\sigma^{3}} = \frac{n}{\sigma} \;\Longrightarrow\; \sigma^2 = \frac{Q}{n}. \qquad Para el signo, se evalúa la segunda derivada \partial^2\ell/\partial\sigma^2 = n/\sigma^2 - 3Q/\sigma^{4} en \sigma^2 = Q/n, donde vale n^2/Q - 3n^2/Q = -2n^2/Q < 0. Es un máximo. ∎
Aquí está la sorpresa. La Proposición 4.10 demostró que el estimador insesgado de la varianza es s^2 = Q/(n-1). Máxima verosimilitud entrega Q/n, que es el otro, el sesgado. El método no comete aquí ningún descuido: entrega el máximo de \ell, que está donde está. El máximo de \ell está donde está.
Proposición 8.7. Para toda muestra con n \ge 2 y Q > 0, \ell(\bar{x},\hat{\sigma}) - \ell(\bar{x},s) = \frac{n}{2}\log\!\frac{n}{n-1} - \frac{1}{2} > 0, cantidad que no depende de los datos, solo de n, y que tiende a cero como 1/(4n).
Demostración. Escribiendo c = -\frac{n}{2}\log(2\pi) y usando \hat{\sigma}^2 = Q/n y s^2 = Q/(n-1): \ell(\bar{x},\hat{\sigma}) = -n\log\hat{\sigma} - \frac{Q}{2\hat{\sigma}^2} + c = -n\log\hat{\sigma} - \frac{n}{2} + c, \ell(\bar{x},s) = -n\log s - \frac{Q}{2s^2} + c = -n\log s - \frac{n-1}{2} + c, porque en cada caso el cociente Q/\sigma^2 se simplifica al propio denominador. Restando, las constantes c se cancelan: \Delta = n\log\frac{s}{\hat{\sigma}} - \frac{n}{2} + \frac{n-1}{2} = n\log\frac{s}{\hat{\sigma}} - \frac{1}{2}. Como s/\hat{\sigma} = \sqrt{n/(n-1)}, el logaritmo vale la mitad de \log\frac{n}{n-1}, lo que da la fórmula del enunciado. El factor Q ha desaparecido: por eso el resultado es el mismo en toda muestra.
Para el signo se usa la serie -\log(1-u) = u + \frac{u^2}{2} + \frac{u^3}{3} + \cdots, válida para 0 < u < 1, con u = 1/n: \frac{n}{2}\log\frac{n}{n-1} = \frac{n}{2}\Big(\frac{1}{n} + \frac{1}{2n^2} + \frac{1}{3n^3} + \cdots\Big) = \frac{1}{2} + \frac{1}{4n} + \frac{1}{6n^2} + \cdots Restando \tfrac12 quedan solo términos positivos, luego \Delta > 0, y el primero de ellos domina: \Delta \sim 1/(4n). ∎
El visual separa lo que cambia de una muestra a otra de lo que no. A la izquierda, la log-verosimilitud sobre el plano (\mu,\sigma) —más intensa donde es mayor— dibujada en un marco fijo, anclado a la población y no a los datos. A la derecha, esa misma superficie cortada en \mu = \bar{x} y medida en unidades de \hat{\sigma}.
Pulsando Otra muestra, el punto naranja del panel izquierdo salta de sitio y va dejando rastro. Los máximos se reparten alrededor de la cruz roja —el parámetro verdadero— sin caer nunca encima: eso es la distribución muestral de (\bar{x}, \hat{\sigma}), y al subir n el enjambre se aprieta contra la cruz.
La curva de la derecha, en cambio, no se mueve ni un píxel por muchas muestras que se sorteen. No es que esté congelada: escribiendo \sigma = r\,\hat{\sigma} y usando \hat{\sigma}^2 = Q/n, \ell(\bar{x},\, r\hat{\sigma}) - \ell(\bar{x},\, \hat{\sigma}) = -n\log r - \frac{n}{2r^{2}} + \frac{n}{2}, expresión en la que los datos han desaparecido: solo quedan r y n. Medida en unidades de \hat{\sigma}, la log-verosimilitud de una normal tiene siempre la misma forma. La Proposición 8.7 es un caso particular de eso, el de r = \sqrt{n/(n-1)}, que es donde cae s; por eso \Delta\ell tampoco depende de los datos. Cambiando n la curva sí se estrecha y \Delta\ell baja hacia cero.
Las dos primeras columnas coinciden en todas las filas, con muestras distintas y Q distinto en cada una: la diferencia solo depende de n. La tercera columna se le acerca desde abajo, como anuncia la serie de la demostración.
Esto deja una consecuencia práctica. numpy.var y numpy.std usan por defecto el denominador n —el de máxima verosimilitud— mientras que pandas.Series.var usa n-1. Ninguno de los dos está equivocado; responden a preguntas distintas. El argumento ddof controla cuál se usa en ambos: ddof=0 da Q/n, ddof=1 da Q/(n-1).
4. Mínimos cuadrados es máxima verosimilitud
Proposición 8.8. Supóngase el modelo x_i = \mu + \varepsilon_i con \varepsilon_i \sim \mathcal{N}(0,\sigma^2) independientes y \sigma conocida y fija. Entonces \arg\max_\mu \ell(\mu) = \arg\min_\mu \sum_{i=1}^{n}(x_i-\mu)^2.
Demostración. De la expresión de \ell de la Proposición 8.6, \ell(\mu) = \underbrace{-n\log\sigma - \frac{n}{2}\log(2\pi)}_{\text{no depende de } \mu} - \frac{1}{2\sigma^2}\sum_{i=1}^{n}(x_i-\mu)^2. El primer bloque es una constante aditiva respecto a \mu y no altera dónde está el máximo. El segundo es -\frac{1}{2\sigma^2} por la suma de cuadrados, y como \frac{1}{2\sigma^2} > 0, maximizar \ell equivale a minimizar esa suma. ∎
La proposición está enunciada para un solo parámetro \mu, pero nada del argumento usa esa restricción: si se sustituye \mu por una predicción g(z_i;\beta) que dependa de otras variables, el término constante sigue siendo constante y la conclusión se mantiene palabra por palabra. De ahí sale el resultado que se usa a diario:
Ajustar una recta por mínimos cuadrados es estimar sus coeficientes por máxima verosimilitud, bajo el supuesto de que los errores son normales, independientes y de varianza constante.
Lo que se gana al verlo así es saber qué se está suponiendo. El método de mínimos cuadrados no exige normalidad para poder calcularse —la Matemática 6 lo obtuvo como proyección ortogonal, sin probabilidad de por medio—, pero sí para que el resultado tenga la interpretación de máxima verosimilitud, y para que valgan los errores estándar y las pruebas que se construyen sobre él en la lección 14. Cuando los errores tienen cola pesada, el cálculo sigue dando un número; lo que deja de valer es su lectura.
5. Lo que máxima verosimilitud no garantiza
La Proposición 8.6 ya mostró que el método puede dar un estimador sesgado. El siguiente caso lo lleva al extremo: un estimador que nunca, en ninguna muestra, puede acertar por arriba.
Proposición 8.9 (uniforme). Sea x_1,\dots,x_n una muestra de una uniforme en [0,\theta]. Entonces \hat{\theta}_{\text{MV}} = \max_i x_i, \qquad E[\hat{\theta}_{\text{MV}}] = \frac{n}{n+1}\,\theta.
Demostración. La densidad es f(x;\theta) = 1/\theta si 0 \le x \le \theta y cero fuera. Por tanto L(\theta) = \prod_{i=1}^{n} f(x_i;\theta) = \begin{cases} \theta^{-n} & \text{si } \theta \ge \max_i x_i,\\[2pt] 0 & \text{si } \theta < \max_i x_i,\end{cases} porque basta que un dato quede fuera de [0,\theta] para que su factor sea cero y anule el producto. Sobre la región donde L no se anula, \theta^{-n} es estrictamente decreciente, así que el máximo se alcanza en el menor \theta admisible, que es \max_i x_i. Aquí la derivada no sirve: el máximo está en el borde del dominio, no en un punto crítico.
Para la esperanza se usa la función acumulada del máximo. Como los x_i son independientes, el máximo es menor o igual que t exactamente cuando todos lo son: F_{\max}(t) = P(\max_i x_i \le t) = \prod_{i=1}^{n} P(x_i \le t) = \Big(\frac{t}{\theta}\Big)^{n}, \qquad 0 \le t \le \theta, donde P(x_i \le t) = t/\theta es la acumulada de la uniforme (Proposición 3.2). Derivando se obtiene la densidad f_{\max}(t) = n\,t^{n-1}/\theta^{n}, y entonces E[\max_i x_i] = \int_{0}^{\theta} t\,\frac{n\,t^{n-1}}{\theta^{n}}\,dt = \frac{n}{\theta^{n}}\int_{0}^{\theta} t^{n}\,dt = \frac{n}{\theta^{n}}\cdot\frac{\theta^{n+1}}{n+1} = \frac{n}{n+1}\,\theta. \qquad ∎
El sesgo es -\theta/(n+1): siempre negativo, nunca nulo. Pero tiende a cero, y puede comprobarse que la varianza también, así que por la Proposición 7.7 el estimador es consistente. Es el habitante más claro de la casilla sesgado y consistente de la tabla de la lección 7.
Dos cosas que el visual deja ver y la fórmula sola no. La primera: el histograma inferior está pegado al borde y no es simétrico, a diferencia de todas las distribuciones muestrales de las lecciones 1 y 6. El teorema central del límite no aplica aquí, porque el máximo no es una suma. La segunda: con n pequeño el estimador se queda cortísimo —con n = 2 se pierde un tercio de \theta—, y el remedio es inmediato: multiplicar por (n+1)/n da un estimador insesgado. Máxima verosimilitud no lo encuentra porque no lo está buscando.
Ejercicios
Ejercicio 1 — La exponencial
Derivar a mano que el estimador de máxima verosimilitud del parámetro \lambda de una exponencial es \hat{\lambda} = 1/\bar{x}, y comprobarlo aquí maximizando \ell sobre una rejilla. Devolver la diferencia absoluta entre el máximo numérico y 1/\bar{x}.
\ell(\lambda) = \sum_i \log\big(\lambda e^{-\lambda x_i}\big) = n\log\lambda - \lambda\sum_i x_i. Con rejilla como vector, len(x) * np.log(rejilla) - rejilla * x.sum() evalúa esa expresión en todos los puntos de golpe.
ell = len(x) * np.log(rejilla) - rejilla * x.sum()Derivando la expresión a mano: \ell'(\lambda) = n/\lambda - \sum_i x_i = 0 da \lambda = n/\sum_i x_i = 1/\bar{x}. La segunda derivada es -n/\lambda^2 < 0, luego es un máximo.
Ejercicio 2 — El sesgo del máximo
Estimar por simulación E[\max_i x_i] para una uniforme en [0,\theta] con \theta = 1 y n = 6, y compararlo con la Proposición 8.9. Devolver la diferencia absoluta entre lo medido y n/(n+1).
rng.random(size=(reps, n)) da una matriz de uniformes en [0,1). El máximo por filas es .max(axis=1).
maximos = rng.random(size=(reps, n)).max(axis=1)Con n = 6 la proposición predice E[\hat{\theta}] = 6/7 \approx 0.857 y un sesgo de -1/7 \approx -0.143. Obsérvese que ningún máximo llega nunca a 1: el soporte del estimador está enteramente por debajo del parámetro.
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 08:
- Escribir
mv_rejilla(logL, a, b, puntos)que maximice cualquier log-verosimilitud de un parámetro por búsqueda en rejilla, ymv_newton(dlogL, d2logL, inicio)que lo haga por el método de Newton. Aplicar ambas a la Bernoulli, la exponencial y la Poisson, y comparar cuántas evaluaciones necesita cada una para la misma precisión. - Para la normal con \sigma desconocida, dibujar la superficie \ell(\mu,\sigma) como curvas de nivel con
matplotlib. Marcar el máximo, el punto (\bar{x}, s) y el camino que sigue el ascenso por gradiente desde una esquina. Comprobar que el camino termina en el primero y no en el segundo. - Repetir el caso uniforme de la Proposición 8.9 con el estimador corregido \frac{n+1}{n}\max_i x_i. Verificar que es insesgado y calcular su ECM. Compararlo con el ECM del estimador de máxima verosimilitud sin corregir: ¿cuál es menor, y para qué valores de n?
Del libro
Think Bayes se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente. La definición de verosimilitud citada en la sección 1 es la que se usa aquí, con una diferencia de encuadre: Downey la presenta como uno de los factores del teorema de Bayes, y esta lección la mira sola.
El tratamiento paralelo de la estimación de parámetros en el plan es MML §8.3 Parameter Estimation, dentro del capítulo 8 When Models Meet Data, y su aplicación a la regresión en MML §9.2 Parameter Estimation y §9.4 Maximum Likelihood as Orthogonal Projection. Este último título es, literalmente, la Proposición 8.8 de arriba unida a la Matemática 6.
No se cita texto de MML porque no se pudo extraer su contenido de forma verificable al escribir esta página: solo se comprobaron los números y títulos de sección contra el índice del PDF oficial. Los enunciados y demostraciones de arriba están escritos aquí y no reproducen los del libro; pueden diferir en notación y en el orden de los pasos.
Preguntas para leer §8.3 y §9.4 con lápiz:
- Comparar la deducción de \hat{\mu} = \bar{x} del libro con la Proposición 8.6. ¿Deriva respecto a \mu igual que aquí, o llega por otro camino?
- §9.4 se titula Maximum Likelihood as Orthogonal Projection. Antes de leerla: ¿qué espacio se proyecta sobre cuál, y qué papel juega el supuesto de normalidad? Contrastar la respuesta propia con la del libro.
- ¿Qué dice el libro sobre qué ocurre cuando el máximo de \ell no es único, o cae en la frontera del dominio? El caso uniforme de la Proposición 8.9 es un ejemplo de lo segundo.
Para el Cerebro
Nota nueva en 10-Conceptos/maxima-verosimilitud.md, enlazada a [[estimacion]], [[esperanza-varianza]] y [[minimos-cuadrados]]. La Proposición 8.6 conviene derivarla a mano dos veces: aparece otra vez en regresión lineal y en regresión logística casi sin cambios.
¿Qué es la verosimilitud?::La probabilidad o densidad de los datos observados, leída como función del parámetro con los datos fijos
¿La verosimilitud es una distribución de probabilidad sobre θ?::No. No integra uno en θ. Es la misma fórmula que la densidad, leída al revés
¿Por qué se usa la log-verosimilitud?::Porque el máximo está en el mismo sitio y la suma de logaritmos no sufre underflow, mientras que el producto sí
¿Qué es el estimador de máxima verosimilitud?::El valor del parámetro que hace más probables los datos que se observaron
¿Cuál es el MV de una proporción?::k/n, la proporción muestral
¿Cuál es el MV de la varianza de una normal?::Q/n, con denominador n: el sesgado, no s²
¿Es eso un error del método?::No. El método maximiza la verosimilitud, no busca insesgadez. Son objetivos distintos
¿Cuánto vale ℓ(σ̂) − ℓ(s)?::(n/2)·log(n/(n−1)) − 1/2, que no depende de los datos y tiende a cero como 1/(4n)
¿Qué relación hay entre mínimos cuadrados y máxima verosimilitud?::Minimizar la suma de cuadrados es maximizar la verosimilitud si los errores son normales, independientes y de varianza constante
¿Qué se gana al ver los mínimos cuadrados así?::Saber qué se está suponiendo: si los errores no son normales el cálculo sigue dando un número, pero su interpretación deja de valer
¿Cuál es el MV de θ en una uniforme [0,θ]?::El máximo de la muestra
¿Por qué ahí no sirve derivar?::Porque el máximo de L está en la frontera del dominio, no en un punto crítico
¿Cuánto vale E[máx xᵢ] en ese caso?::n/(n+1)·θ, siempre menor que θ: el estimador es sesgado en toda muestra
¿Es consistente pese a ser sesgado?::Sí: el sesgo −θ/(n+1) y la varianza tienden a cero, y por la Proposición 7.7 eso basta
Fuentes
Lo que esta página demuestra sola. Las Proposiciones 8.3, 8.5, 8.6, 8.7, 8.8 y 8.9 se demuestran aquí paso a paso, a partir de la Definición 2.9 (independencia), la Proposición 3.2 (acumulada de la uniforme) y la Proposición 7.7 (consistencia por ECM). La Proposición 8.7 se comprueba además numéricamente en la celda de la sección 3, con muestras distintas en cada fila, y las dos columnas cuadran; el estimador de la uniforme se mide en el navegador contra n/(n+1)\theta.
Lo que viene de los libros.
- Think Bayes 2e (Downey, CC BY-NC-SA 4.0), §2.2 Diachronic Bayes — citada textualmente la definición de verosimilitud.
- Mathematics for Machine Learning (Deisenroth, Faisal & Ong), §8.3 Parameter Estimation, §9.2 Parameter Estimation y §9.4 Maximum Likelihood as Orthogonal Projection — referenciadas por número y título verificados contra el índice del PDF oficial. No se cita texto suyo: no se pudo extraer su contenido de forma verificable.
Lo que es mío, no del libro. La numeración de definiciones y proposiciones. La Proposición 8.7 y su demostración por serie: es un resultado elemental, pero no se ha tomado de ninguna de las fuentes citadas. La lectura del caso uniforme como habitante de la casilla sesgado y consistente de la lección 7, y el argumento de underflow como razón práctica para la Proposición 8.3, son forma de presentarlo.
Índices verificados el 12-09-2026 contra los índices publicados de los libros.
→ Siguiente: Intervalos de confianza