Función de masa, densidad y acumulada
Estadística · Lección 2
Objetivo
Al terminar esta lección se puede:
- Escribir una distribución de las tres formas —función de masa, función de densidad y función de distribución acumulada— y decir cuál aplica a cada tipo de variable.
- Explicar por qué f(x) no es una probabilidad y F(x) sí.
- Calcular percentiles y rangos percentiles a partir de la acumulada.
- Demostrar la transformada integral de probabilidad y usarla para simular cualquier distribución a partir de números uniformes.
De dónde viene
- Lección 1: la Definición 1.5 dice que una distribución describe qué valores puede tomar X y con qué probabilidad, sin decir cómo se escribe. Esta lección da las tres formas de escribirla.
- Lección 1: la distinción entre variable discreta y continua (Definición 1.8) es la que obliga a tener dos objetos distintos, p(x) y f(x).
Para qué sirve después
- Lección 3: las familias analíticas se identifican comparando la acumulada empírica con la teórica. Sin la CDF no hay diagnóstico posible.
- Lección 4: la esperanza se define con p(x) en el caso discreto y con f(x) en el continuo; son las dos fórmulas de la Definición 4.1.
- Lección 10: un intervalo de confianza es un par de percentiles de una distribución muestral.
- Lección 12: el bootstrap genera muestras y lee percentiles de la acumulada de los resultados.
- Estadística 3 y el reto de aquí: la simulación por inversión que se demuestra en la Proposición 2.6 es la manera estándar de generar datos con una distribución dada.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| p(x) | pe de equis | Función de masa: P(X = x). Solo para variables discretas |
| f(x) | efe de equis | Función de densidad. Solo para variables continuas |
| F(x) | efe mayúscula de equis | Función de distribución acumulada: P(X \le x) |
| F^{-1}(q) | efe inversa de cu | La función inversa de F: devuelve el valor con acumulada q |
| q | cu | Una proporción entre 0 y 1 |
| U | u mayúscula | Una variable aleatoria uniforme en el intervalo [0,1] |
| \int_a^b | integral de a a be | Área bajo la curva entre a y b |
| \hat{F}_n(x) | efe gorro sub ene | Acumulada empírica: la calculada con n datos |
Mayúscula y minúscula significan cosas distintas otra vez: F acumula, f no. La convención se mantiene en todo el módulo.
1. Tres formas de escribir una distribución
Una variable discreta y una continua necesitan objetos distintos, y la razón se ve en una pregunta.
Para un dado, P(X = 3) = 1/6: la pregunta tiene sentido y la respuesta es positiva. Para una estatura medida con precisión infinita, P(X = 1.74\ldots) = 0, porque hay infinitos valores posibles y ninguno concentra probabilidad. Solo los intervalos la tienen.
Definición 2.1 (función de masa). Para una variable discreta, la función que asigna a cada valor su probabilidad: p(x) = P(X = x), \qquad p(x) \ge 0, \qquad \sum_x p(x) = 1.
A function that represents a distribution by mapping each quantity to its probability.
Downey, Think Stats 3e, §3.1 PMFs
Definición 2.2 (función de densidad). Para una variable continua, la función f tal que la probabilidad de caer en un intervalo es el área bajo ella: P(a < X \le b) = \int_a^b f(x)\,dx, \qquad f(x) \ge 0, \qquad \int_{-\infty}^{\infty} f(x)\,dx = 1.
f(x) no es una probabilidad. Es una densidad: probabilidad por unidad de x. Puede valer más que 1 sin contradicción alguna. Si X es uniforme en [0, 0.5], entonces f(x) = 2 en todo ese intervalo, porque el área —2 \times 0.5 = 1— sí debe valer uno. Lo que nunca puede pasar de 1 es el área.
Definición 2.3 (función de distribución acumulada). Para cualquier variable aleatoria, discreta o continua: F(x) = P(X \le x).
Given a value
x, the CDF computes the fraction of values less than or equal tox.Downey, Think Stats 3e, §4.2 CDFs
La acumulada es la única de las tres que funciona en los dos casos, y por eso es la herramienta de diagnóstico del módulo.
| Discreta | Continua | ¿Es una probabilidad? | |
|---|---|---|---|
| p(x) | sí | inútil: vale 0 siempre | sí |
| f(x) | no aplica | sí | no, es densidad |
| F(x) | sí | sí | sí |
Proposición 2.4 (propiedades de F). Para toda variable aleatoria:
- F es no decreciente.
- \lim_{x \to -\infty} F(x) = 0 y \lim_{x \to +\infty} F(x) = 1.
- P(a < X \le b) = F(b) - F(a).
- Si X es continua con densidad f, entonces F'(x) = f(x) donde f es continua.
Demostración. (1) Si x_1 \le x_2, el suceso \{X \le x_1\} está contenido en \{X \le x_2\}, y la probabilidad de un suceso contenido en otro no puede ser mayor.
\{X \le x\} tiende al suceso imposible cuando x \to -\infty y al suceso seguro cuando x \to +\infty.
El suceso \{X \le b\} se parte en dos trozos que no se solapan: \{X \le a\} y \{a < X \le b\}. Sus probabilidades se suman, así que F(b) = F(a) + P(a < X \le b).
Por la Definición 2.2, F(x) = \int_{-\infty}^{x} f(t)\,dt. Derivar esa expresión respecto a su límite superior devuelve el integrando, por el teorema fundamental del cálculo. ∎
La cuarta propiedad dice que densidad y acumulada son la misma información escrita de dos maneras: una es la derivada de la otra. El visual siguiente muestra las dos a la vez.
Dos cosas que la Proposición 2.4 predice y ahí se ven:
- La acumulada nunca baja. Puede quedarse plana, donde la densidad es cero, pero no desciende.
- Donde la densidad es alta, la acumulada sube rápido. La pendiente de F es f.
2. Percentiles
Definición 2.5 (percentil y rango percentil). El rango percentil de un valor x es 100 \cdot F(x): el porcentaje de la distribución que queda en x o por debajo. El percentil q es el valor F^{-1}(q) que deja una proporción q por debajo.
The percentile rank is the percentage of people who got the same score as you or lower.
Downey, Think Stats 3e, §4.1 Percentiles and Percentile Ranks
Las dos operaciones son inversas: el rango percentil va de valor a proporción, el percentil va de proporción a valor. La mediana es el percentil 0.5.
3. La acumulada empírica
Con datos reales no se conoce F. Se estima contando.
Definición 2.6 (acumulada empírica). Dados x_1, \dots, x_n, la función \hat{F}_n(x) = \frac{\text{número de } x_i \le x}{n}.
Es una escalera con un escalón de altura 1/n en cada dato. No requiere elegir el ancho de ningún intervalo, y esa es su ventaja decisiva sobre el histograma: dos histogramas del mismo conjunto de datos pueden parecer distribuciones distintas según dónde caigan los cortes, mientras que la acumulada empírica es única.
El último cálculo aplica la propiedad 3 de la Proposición 2.4: una probabilidad de intervalo es una resta de acumuladas.
4. La transformada integral de probabilidad
Este resultado convierte la acumulada en una máquina de generar datos, y es la base de casi toda simulación.
Proposición 2.7 (transformada integral). Sea X continua con acumulada F estrictamente creciente. Entonces:
- F(X) \sim \text{Uniforme}(0,1).
- Si U \sim \text{Uniforme}(0,1), entonces F^{-1}(U) tiene la misma distribución que X.
Demostración. (1) Sea U = F(X) y tomemos q \in (0,1). Como F es estrictamente creciente admite inversa, y aplicarla a los dos lados de una desigualdad conserva el sentido: P(U \le q) = P\big(F(X) \le q\big) = P\big(X \le F^{-1}(q)\big) = F\big(F^{-1}(q)\big) = q. Una variable cuya acumulada es P(U \le q) = q en [0,1] es, por definición, uniforme en ese intervalo.
- Sea Y = F^{-1}(U). Entonces, para cualquier x: P(Y \le x) = P\big(F^{-1}(U) \le x\big) = P\big(U \le F(x)\big) = F(x), donde el último paso usa que U es uniforme y que F(x) \in [0,1]. Así que Y tiene la misma acumulada que X, y por tanto la misma distribución. ∎
La parte (2) es la receta: para generar datos con la distribución que se quiera, basta con sortear un número uniforme y pasarlo por F^{-1}. La primera parte es la que hace funcionar los diagnósticos de la lección 3 y los valores p de la lección 11.
Ejercicios
Ejercicio 1 — Acumulada empírica
Implementar la Definición 2.6.
Tras ordenar, el i-ésimo valor (contando desde 1) tiene exactamente i datos menores o iguales, así que su acumulada es i/n. En NumPy, np.arange(1, n+1) / n.
Ejercicio 2 — Simular por inversión
Generar datos con distribución de Pareto usando la Proposición 2.7. Su acumulada es F(x) = 1 - (x/x_m)^{-\alpha} para x \ge x_m, de donde F^{-1}(q) = x_m\,(1-q)^{-1/\alpha}.
Traduce F^{-1}(q) = x_m\,(1-q)^{-1/\alpha} sustituyendo q por u: XM * (1 - u)**(-1/ALFA).
Reto
En proyectos/notebooks/F0-retos.ipynb, sección Est 02:
- Escribir
percentil(datos, q)sin usarnp.percentile, y comparar con NumPy en cinco distribuciones. Existen varias convenciones de interpolación para percentiles: averiguar cuál usa NumPy por defecto y documentarla. - Graficar dos acumuladas empíricas en los mismos ejes y, aparte, los dos histogramas correspondientes. Repetir los histogramas con tres anchos de intervalo distintos. Determinar cuál de las dos representaciones deja más clara la diferencia entre los grupos y por qué.
- Implementar la simulación por inversión para la exponencial, la Pareto y la logística, verificando en cada caso que la media, la mediana y tres percentiles coinciden con los valores teóricos. Comprobar después la parte (1) de la Proposición 2.7: pasar los datos generados por su propia F y verificar que el resultado es uniforme.
Del libro
Think Stats se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente.
the probability of observing a class is proportional to its size
Downey, Think Stats 3e, §3.3 The Class Size Paradox
Esa frase resume el sesgo de tamaño: si se pregunta a estudiantes por el tamaño de su clase, las clases grandes aparecen más veces porque tienen más estudiantes que las reporten, y la media observada sale por encima de la real. El mismo mecanismo actúa siempre que la probabilidad de que una unidad entre en la muestra depende de su tamaño.
Preguntas para leer §3 y §4 con lápiz:
- §3.2 se titula Summarizing a PMF. ¿Qué resúmenes propone Downey, y cómo se calculan directamente desde la función de masa sin volver a los datos?
- §3.3 desarrolla la paradoja del tamaño de clase. ¿Cómo corrige la distribución sesgada para recuperar la real, y qué operación hay que aplicarle a cada probabilidad?
- §4.3 compara acumuladas de dos grupos. ¿Qué diferencia observa entre ellos y por qué dice que la comparación con funciones de masa no funcionaba?
Para el Cerebro
Nota nueva en 10-Conceptos/cdf.md y 20-Metodos/simulacion-por-inversion.md, enlazadas a [[poblacion-muestra]]. Registrar en 50-Errores/ que f(x) puede pasar de 1 y no es una probabilidad.
¿Qué es la función de masa?::p(x) = P(X = x), para variables discretas
¿Qué es la función de densidad?::f(x), cuya integral sobre un intervalo da la probabilidad de caer en él
¿Puede f(x) valer más que 1?::Sí: es densidad, no probabilidad. Lo que no puede pasar de 1 es el área
¿Qué es la función de distribución acumulada?::F(x) = P(X ≤ x), definida para discretas y continuas
¿Qué relación hay entre f y F?::F es la integral de f, y f es la derivada de F
¿Cómo se calcula P(a < X ≤ b) con la acumulada?::F(b) − F(a)
¿Qué es el rango percentil de un valor?::100·F(x): el porcentaje de la distribución en x o por debajo
¿Qué es la acumulada empírica?::La proporción de datos menores o iguales a x: una escalera con escalones de 1/n
¿Por qué la acumulada empírica es mejor que el histograma para comparar?::Porque no depende del ancho de los intervalos: es única para unos datos dados
¿Qué dice la transformada integral de probabilidad?::Que F(X) es uniforme en [0,1], y que F⁻¹(U) tiene la distribución de X
¿Cómo se simula cualquier distribución?::Sorteando U uniforme y evaluando F⁻¹(U)
¿Qué es el sesgo de tamaño?::Que la probabilidad de observar una unidad sea proporcional a su tamaño, lo que infla la media observada
Fuentes
Lo que esta página demuestra sola. La correspondencia entre densidad y acumulada del visual, los percentiles calculados sobre la acumulada empírica y la equivalencia entre simular por inversión y usar el generador de NumPy se calculan en el navegador al abrir la página.
Lo que viene de los libros.
- Think Stats 3e (Downey, CC BY-NC-SA 4.0), §3 Probability Mass Functions y §4 Cumulative Distribution Functions — citado textualmente arriba.
Lo que es mío, no del libro. La numeración de definiciones y proposiciones. La demostración de la Proposición 2.7 no aparece en Think Stats, que usa la inversión sin derivarla; está escrita aquí y se comprueba con el código. La tabla que compara las tres representaciones es forma de presentarlo.
Índices verificados el 12-09-2026 contra el índice publicado del libro.
→ Siguiente: Distribuciones analíticas