Distribuciones analíticas
Estadística · Lección 3
Objetivo
Al terminar esta lección se puede:
- Enunciar la función de densidad y la acumulada de la exponencial, la normal, la lognormal y la Pareto.
- Derivar la exponencial a partir de la falta de memoria, y la lognormal a partir de un producto de factores.
- Demostrar en qué sistema de coordenadas cada familia se vuelve una línea recta, y usarlo para identificarla a partir de datos.
- Explicar por qué ajustar solo la cola de una distribución no es evidencia de nada.
De dónde viene
- Lección 2: la acumulada F(x) y su complemento 1 - F(x) son el objeto sobre el que se trabaja toda la lección.
- Lección 2: la acumulada empírica de la Definición 2.6 es lo que se contrasta contra cada familia.
- Lección 2: la transformada integral (Proposición 2.7) genera los datos simulados que se usan aquí.
Para qué sirve después
- Lección 4: la exponencial y la lognormal son los ejemplos de distribución asimétrica donde media y mediana se separan.
- Lección 6: la normal de aquí, en una dimensión, se generaliza a varias.
- Lección 7: el teorema central del límite explica por qué la normal aparece en tantos sitios, cosa que aquí se acepta sin justificar.
- Lección 9: estimar \lambda, \mu y \sigma por máxima verosimilitud parte de las densidades que aquí se enuncian.
- Lección 16: las colas pesadas de la Pareto son la razón de que ciertos promedios no converjan y de que ciertas métricas de error engañen.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| f(x) | efe de equis | Función de densidad |
| F(x) | efe mayúscula | Acumulada, P(X \le x) |
| G(x) | ge de equis | Complemento de la acumulada, 1 - F(x) = P(X > x) |
| \lambda | lambda | Tasa de la exponencial: eventos por unidad de tiempo |
| \mu, \sigma | mu, sigma | Media y desviación de la normal. En la lognormal, de su logaritmo |
| \alpha | alfa | Exponente de la cola de la Pareto |
| x_m | equis sub eme | Valor mínimo de la Pareto |
| \Phi(z) | fi de zeta | Acumulada de la normal estándar |
| \Phi^{-1}(q) | fi inversa | Su inversa, llamada función probit |
| \log | logaritmo | Siempre natural, base e |
El complemento G(x) = P(X > x) merece su propio símbolo porque es el protagonista de la lección: casi todas las familias se linealizan tomando logaritmos de G, no de F.
1. Qué es una distribución analítica
Definición 3.1 (familia paramétrica). Un conjunto de distribuciones descritas por la misma fórmula, que se distinguen entre sí por el valor de unos pocos parámetros.
Ajustar una familia a unos datos sirve para tres cosas: resumir miles de observaciones en dos o tres números, extrapolar a la región donde no hay datos, y —la más útil— formular una hipótesis sobre el proceso que los generó. Cada familia se deduce de un mecanismo distinto, y reconocer la familia es reconocer el mecanismo.
2. La exponencial
Definición 3.2 (exponencial). X \sim \text{Exp}(\lambda), con \lambda > 0, si para x \ge 0 f(x) = \lambda e^{-\lambda x}, \qquad F(x) = 1 - e^{-\lambda x}, \qquad G(x) = e^{-\lambda x}.
Esta familia no se postula: se deduce de una sola propiedad.
Definición 3.3 (falta de memoria). Una variable X \ge 0 no tiene memoria si para todos s, t \ge 0 P(X > s + t \mid X > s) = P(X > t).
En palabras: haber esperado ya s unidades de tiempo no cambia la distribución de lo que queda por esperar. El sistema no envejece.
Proposición 3.4. La exponencial es la única distribución continua sobre [0,\infty) que no tiene memoria.
Demostración. Sea G(x) = P(X > x). Por la definición de probabilidad condicional, P(A \mid B) = P(A \cap B)/P(B), y como el suceso \{X > s+t\} está contenido en \{X > s\}, su intersección es él mismo: P(X > s+t \mid X > s) = \frac{G(s+t)}{G(s)}. Igualando a G(t) según la Definición 3.3 se obtiene la ecuación funcional G(s+t) = G(s)\,G(t) \qquad \text{para todos } s,t \ge 0.
Tomando logaritmos y escribiendo h(x) = \log G(x), la ecuación se convierte en h(s+t) = h(s) + h(t). Una función que convierte sumas en sumas y es monótona —G lo es, porque es un complemento de acumulada— solo puede ser lineal: h(x) = cx para alguna constante c. Como G es no creciente y G(0) = 1, la constante es negativa; escribiéndola c = -\lambda con \lambda > 0: \log G(x) = -\lambda x \quad\Longrightarrow\quad G(x) = e^{-\lambda x}. De ahí F(x) = 1 - e^{-\lambda x} y, derivando (Proposición 2.4, parte 4), f(x) = \lambda e^{-\lambda x}. ∎
Proposición 3.5 (linealización). Para una exponencial, \log G(x) = -\lambda x. En un gráfico de \log G contra x, los puntos caen sobre una recta de pendiente -\lambda que pasa por el origen.
La demostración es la última línea de la anterior. Lo que importa es el uso: la pendiente de esa recta estima \lambda sin necesidad de conocer la fórmula de antemano.
2.1 De dónde sale la falta de memoria
Un proceso de Poisson es un flujo de eventos que ocurren a tasa constante y de forma independiente unos de otros. El tiempo entre dos eventos consecutivos de ese proceso es exponencial, y el visual muestra por qué.
La marca del tiempo cero no es especial: si se empieza a mirar en cualquier otro instante, la espera hasta el siguiente evento tiene la misma distribución. Eso es la Definición 3.3 vista sobre la línea de tiempo.
3. La normal
Definición 3.6 (normal). X \sim \mathcal{N}(\mu, \sigma^2) si f(x) = \frac{1}{\sigma\sqrt{2\pi}}\,e^{-\frac{1}{2}\left(\frac{x-\mu}{\sigma}\right)^2}, \qquad F(x) = \Phi\!\left(\frac{x-\mu}{\sigma}\right), donde \Phi es la acumulada de la normal estándar \mathcal{N}(0,1), que no tiene forma cerrada elemental.
Aquí no se deriva. La normal aparece cuando se suman muchos efectos pequeños e independientes, y ese enunciado es el teorema central del límite, que llega en la lección 7 con su demostración.
Proposición 3.7 (linealización). Para una normal, \Phi^{-1}(F(x)) = \dfrac{x-\mu}{\sigma} = \dfrac{1}{\sigma}x - \dfrac{\mu}{\sigma}. En un gráfico de \Phi^{-1}(F) contra x, los puntos caen sobre una recta de pendiente 1/\sigma e intercepto -\mu/\sigma.
Demostración. Aplicar \Phi^{-1} a los dos lados de F(x) = \Phi\big((x-\mu)/\sigma\big) y usar que \Phi^{-1}\circ\Phi es la identidad. ∎
Ese gráfico se llama normal probability plot, y sus dos coeficientes recuperan \mu y \sigma sin calcular ninguna media. La forma en que los puntos se desvían de la recta también informa: una curvatura hacia arriba en los extremos indica colas más pesadas que las normales; hacia abajo, más ligeras.
4. La lognormal
Definición 3.8 (lognormal). X es lognormal con parámetros \mu y \sigma si \log X \sim \mathcal{N}(\mu, \sigma^2). Equivalentemente, para x > 0 F(x) = \Phi\!\left(\frac{\log x - \mu}{\sigma}\right).
Los parámetros \mu y \sigma no son la media y la desviación de X: son las de su logaritmo. Es la confusión más habitual con esta familia.
Proposición 3.9 (mecanismo multiplicativo). Sean Y_1, \dots, Y_k factores positivos, independientes y con la misma distribución. Entonces el producto P_k = \prod_{i=1}^{k} Y_i tiende a una lognormal cuando k crece.
Demostración. Tomando logaritmos, el producto se convierte en una suma: \log P_k = \sum_{i=1}^{k} \log Y_i. Los sumandos \log Y_i son independientes y con la misma distribución, así que el teorema central del límite (lección 7) dice que su suma tiende a una normal. Por tanto \log P_k tiende a una normal y, por la Definición 3.8, P_k tiende a una lognormal. ∎
La consecuencia práctica: lo que se forma sumando tiende a normal; lo que se forma multiplicando tiende a lognormal. Cualquier cantidad que crezca por porcentajes, o que sea el producto de varios factores, es candidata a lognormal.
Sube k con la casilla desmarcada: la asimetría crece. Márcala: en escala logarítmica reaparece la campana. La Proposición 3.9 en dos movimientos.
Proposición 3.10 (linealización). Para una lognormal, \Phi^{-1}(F(x)) = \dfrac{1}{\sigma}\log x - \dfrac{\mu}{\sigma}: la misma recta de la Proposición 3.7, pero contra \log x.
5. La Pareto
Definición 3.11 (Pareto). X \sim \text{Pareto}(x_m, \alpha), con x_m, \alpha > 0, si para x \ge x_m G(x) = P(X > x) = \left(\frac{x}{x_m}\right)^{-\alpha}.
Proposición 3.12 (linealización e invariancia de escala). Para una Pareto:
- \log G(x) = -\alpha \log x + \alpha \log x_m: recta de pendiente -\alpha contra \log x.
- La distribución condicional de X dado X > c, reescalada por c, es de nuevo Pareto con el mismo \alpha.
Demostración. (1) Tomar logaritmos en la Definición 3.11.
- Para x \ge c \ge x_m, por la definición de probabilidad condicional, P(X > x \mid X > c) = \frac{G(x)}{G(c)} = \frac{(x/x_m)^{-\alpha}}{(c/x_m)^{-\alpha}} = \left(\frac{x}{c}\right)^{-\alpha}, que es la Definición 3.11 con x_m sustituido por c y el mismo \alpha. ∎
La parte (2) dice que la forma de la cola es la misma a cualquier escala: mirar el 20 % superior de una Pareto devuelve otra Pareto con el mismo exponente. Por eso las reglas del tipo “una fracción pequeña concentra la mayor parte del total” se siguen cumpliendo dentro de cada subconjunto de la cola, y no solo globalmente.
6. Identificar la familia: cambiar de papel
Las Proposiciones 3.5, 3.7, 3.10 y 3.12 dicen lo mismo cuatro veces: cada familia se convierte en una recta bajo cierta transformación de los ejes. Reunidas:
| Familia | Eje horizontal | Eje vertical | Pendiente |
|---|---|---|---|
| Exponencial | x | \log G(x) | -\lambda |
| Normal | x | \Phi^{-1}(F(x)) | 1/\sigma |
| Lognormal | \log x | \Phi^{-1}(F(x)) | 1/\sigma |
| Pareto | \log x | \log G(x) | -\alpha |
Antes de las computadoras se vendía papel milimetrado con estas escalas ya impresas, y el analista dibujaba sus datos en cada uno hasta que salía recto. El procedimiento sigue siendo válido; solo cambia que ahora el papel se cambia con un botón.
Para medir “qué tan recto” sin depender del ojo se usa el coeficiente de determinación R^2 del ajuste a una recta, que se define en la lección 5 y aquí se usa solo como número entre 0 y 1: cuanto más cerca de 1, más recta.
Para cada familia, el papel ganador es el que predice su proposición. Ese es el método completo.
Los cuatro parámetros salen de una pendiente, sin usar ninguna fórmula de estimación.
7. Por qué la cola no es evidencia
Existe una tentación constante al trabajar con datos asimétricos: quedarse con el 5 % superior y ajustar ahí una Pareto. El experimento siguiente muestra qué produce ese procedimiento.
Los datos son lognormales en las cuatro filas. Leyendo por columnas:
- Recortar al 5 % superior da R^2 \approx 0.98 en papel Pareto para toda \sigma, incluida la de cola más ligera. La causa no está en que las lognormales de cola pesada engañen, sino en que 300 puntos seleccionados por ser los mayores abarcan tan poco rango que casi cualquier curva suave se ve recta sobre ellos.
- Sobre el rango completo, el mismo papel se queda en \approx 0.81 y no mejora con \sigma. La familia equivocada no logra pasar de ahí.
- El papel correcto da \approx 0.9997 en los cuatro casos.
De ahí la regla: comparar familias sobre el rango completo, cada una en su papel. Una familia que solo gana después de recortar la cola no ha ganado. Un R^2 alto calculado sobre los 300 valores más grandes de una muestra no es evidencia de nada.
Ejercicios
Ejercicio 1 — Complemento de la acumulada empírica
Implementar la función sobre la que descansa toda la lección. Las posiciones de graficación son (i + 0.5)/n para i = 0, \dots, n-1.
La acumulada en la posición i es (i + 0.5)/n, y G = 1 - F. En NumPy: 1 - (np.arange(n) + 0.5) / n.
Ejercicio 2 — Estimar λ desde la pendiente
Aplicar la Proposición 3.5: ajustar una recta al logaritmo del complemento de la acumulada y leer \lambda de la pendiente.
La Proposición 3.5 dice \log G(x) = -\lambda x, así que la pendiente del ajuste de np.log(g) contra v es -\lambda. Con np.polyfit(v, np.log(g), 1) se obtiene [pendiente, intercepto].
Reto
En proyectos/notebooks/F1-retos.ipynb, sección Est 03:
- Escribir
elegir_familia(muestra)que calcule R^2 en los cuatro papeles de la tabla y devuelva un ranking. Probarla con 200 muestras de cada familia y construir la matriz de confusión para n = 100, 1000 y 10\,000. Determinar qué familia se confunde con cuál y a partir de qué n deja de confundirse. - Descargar un conjunto de datos público de tiempos entre eventos o de magnitudes positivas y pasarlo por esa función. Escribir el párrafo de conclusión: qué familia, qué mecanismo implica, y qué decisión cambiaría si la familia fuera otra.
- Implementar el estimador de Hill para el \alpha de una Pareto y compararlo con el de la pendiente log-log en 500 simulaciones. Graficar las dos distribuciones de estimaciones. Los dos son insesgados: la diferencia está en la eficiencia, y la explicación está en cómo pesa cada punto de la cola.
Del libro
Think Stats se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.
The normal model fits the data well except below 5 pounds, where the distribution of the data is to the left of the model – that is, the lightest babies are lighter than we’d expect in a normal distribution.
Downey, Think Stats 3e, §5.4 The Normal Distribution
Es un ejemplo de lo que la Proposición 3.7 permite diagnosticar: la desviación no está repartida, sino concentrada en una cola, lo que sugiere que la muestra mezcla dos poblaciones distintas en vez de una sola mal modelada.
Preguntas para leer §5 con lápiz:
- §5.1 y §5.2 tratan la binomial y la Poisson, que esta lección no cubre. ¿Qué mecanismo genera cada una, y qué relación tiene la Poisson con la exponencial de la Definición 3.2?
- §5.4 ajusta un modelo normal a los pesos al nacer. ¿Dónde deja de ajustar, y qué explicación da Downey?
- §5.5 deriva la lognormal desde un modelo de crecimiento proporcional. Comparar ese argumento con la demostración de la Proposición 3.9: ¿son el mismo argumento?
Para el Cerebro
Nota nueva en 10-Conceptos/distribuciones-analiticas.md, enlazada a [[cdf]] y a la que escribirás sobre el teorema central del límite. Reescribir de memoria, sin mirar, la tabla familia → papel → pendiente del apartado 6: esa tabla es la herramienta que se usa el resto del curso.
¿Qué es una familia paramétrica?::Un conjunto de distribuciones con la misma fórmula, distinguidas por unos pocos parámetros
¿Qué propiedad caracteriza a la exponencial?::La falta de memoria: P(X > s+t | X > s) = P(X > t)
¿Qué ecuación funcional produce la falta de memoria?::G(s+t) = G(s)G(t), cuya única solución monótona es e^(−λx)
¿En qué papel es recta la exponencial?::log G contra x, con pendiente −λ
¿En qué papel es recta la normal?::Φ⁻¹(F) contra x, con pendiente 1/σ e intercepto −μ/σ
¿En qué papel es recta la lognormal?::Φ⁻¹(F) contra log x: la misma recta que la normal, en escala logarítmica
¿En qué papel es recta la Pareto?::log G contra log x, con pendiente −α
¿Qué mecanismo genera una lognormal?::El producto de muchos factores independientes: al tomar logaritmos se convierte en una suma
¿Qué mecanismo genera una normal?::La suma de muchos efectos pequeños e independientes
¿Qué significa que la Pareto sea invariante de escala?::Que su cola condicionada por encima de cualquier umbral es otra Pareto con el mismo α
¿Son μ y σ la media y la desviación de una lognormal?::No: son las de su logaritmo
¿Por qué no se puede declarar una power law mirando solo la cola?::Porque 300 puntos seleccionados por ser los mayores abarcan tan poco rango que casi cualquier curva se ve recta
Fuentes
Lo que esta página demuestra sola. Los tres visuales y las dos celdas de código se ejecutan en el navegador: los cuatro parámetros recuperados desde una pendiente, la aparición de la campana al tomar logaritmos de un producto, y la tabla del apartado 7 que muestra el R^2 de la cola frente al del rango completo.
Lo que viene de los libros.
- Think Stats 3e (Downey, CC BY-NC-SA 4.0), §5 Modeling Distributions — cubre la binomial, la Poisson, la exponencial, la normal y la lognormal; citado textualmente arriba.
Lo que es mío, no del libro. La Pareto no aparece en Think Stats 3e; estaba en la 2ª edición y se retiró. Su tratamiento aquí es autocontenido y se verifica con el código. La demostración de la Proposición 3.4 a partir de la ecuación funcional, el encuadre de “cambiar de papel” con la tabla de cuatro transformaciones, y el experimento del apartado 7 son de esta lección: la técnica es clásica, pero esta presentación no procede de ningún capítulo concreto.
Índices verificados el 12-09-2026 contra el índice publicado del libro.
→ Siguiente: Esperanza y varianza