Esperanza y varianza

Estadística · Lección 4

L2 Derivación Fase F1 Libro TS 3e §1.6 · MML §6.4 Prereqs Distribuciones analíticas

Objetivo

Al terminar esta lección se puede:

  1. Calcular la esperanza y la varianza de una variable aleatoria a partir de su función de masa o de su función de densidad.
  2. Demostrar las reglas de linealidad de la esperanza y de escala de la varianza, y usarlas sin recalcular desde cero.
  3. Explicar por qué la varianza muestral divide entre n - 1 y no entre n.
  4. Reconocer una fórmula que es correcta en el papel y falla en la computadora.

De dónde viene

  • Lección 1: la distinción entre variable aleatoria X y valor observado x, y entre población y muestra.
  • Lección 2: la función de masa p(x) y la densidad f(x), que aquí se usan para definir la esperanza.
  • Lección 3: la exponencial y la lognormal, que sirven de ejemplos de distribuciones asimétricas.

Para qué sirve después

  • Lección 5: al calcular \text{Var}(X+Y) aparece un término cruzado. Ese término es la covarianza.
  • Lección 7: el teorema central del límite es un enunciado sobre la media muestral \bar{x} y requiere E y \text{Var} de una suma.
  • Lección 8: sesgo y varianza de un estimador, que aquí se definen por primera vez.
  • Matemática 6 e ISLP cap. 3: la suma de residuos al cuadrado es una varianza, R^2 es un cociente de varianzas, y \hat\sigma^2 divide entre n - p por el mismo argumento que s^2 divide entre n - 1.
  • ISLP cap. 2: la descomposición sesgo–varianza del error de predicción se demuestra expandiendo un cuadrado exactamente como en la Proposición 4.6.

Notación

Símbolo Se lee Significado
X equis mayúscula Una variable aleatoria: la cantidad antes de observarla
x, x_i equis, equis sub i Un valor concreto; el i-ésimo dato de una muestra
p(x) pe de equis Función de masa: P(X = x), variable discreta
f(x) efe de equis Función de densidad, variable continua
E[X] esperanza de equis El valor esperado de X (Definición 4.1)
\mu mu Otro nombre para E[X] cuando se trata como constante
\text{Var}(X), \sigma^2 varianza de equis, sigma cuadrado Definición 4.4
\sigma sigma Desviación estándar, \sqrt{\text{Var}(X)}
n ene Tamaño de la muestra: cuántos datos se observaron
\bar{x} equis barra Media muestral, \frac{1}{n}\sum x_i (Definición 4.8)
s^2 ese cuadrado Varianza muestral con denominador n - 1 (Definición 4.8)
\sum_{i=1}^{n} suma desde i = 1 hasta n Sumar la expresión que sigue para cada dato
a, b a, be Constantes: números fijos, no aleatorios

En las fórmulas de esta página, los símbolos con punteado debajo tienen definición: pasa el cursor por encima y aparece. Los tienes todos juntos en el glosario.

La convención de mayúsculas importa: X es la variable, x es un número. E[X] es un número fijo que depende de la distribución; \bar{x} es un número que depende de la muestra que tocó.

1. Esperanza

Definición 4.1 (esperanza). Sea X una variable aleatoria. Su esperanza, o valor esperado, es

E[X] = \sum_{x} x\,p(x) \quad\text{(discreta)}, \qquad E[X] = \int_{-\infty}^{\infty} x\,f(x)\,dx \quad\text{(continua)},

siempre que la suma o la integral converjan. Se denota también \mu.

En palabras: cada valor posible se multiplica por su probabilidad y se suman los productos. Es un promedio ponderado, con la probabilidad como peso. La esperanza es un número, no una variable aleatoria, y no tiene por qué ser uno de los valores que X puede tomar.

Ejemplo 4.2 (un dado). X toma los valores 1, \dots, 6 con probabilidad 1/6 cada uno: E[X] = \tfrac{1}{6}(1 + 2 + 3 + 4 + 5 + 6) = 3.5. Ningún lanzamiento da 3.5. La esperanza describe la distribución, no un resultado.

Los controles reparten la probabilidad entre las seis caras. La barra inferior es una viga: cada cara cuelga un peso p(x) en la posición x, y el triángulo marca el punto donde la viga se equilibra, que es E[X].

Arrastra las barras para cambiar las probabilidades

En Solo extremos la esperanza vuelve a valer 3.5 aunque la cara 3 y la 4 casi nunca salgan: la esperanza describe dónde se equilibra la distribución, no dónde es probable encontrarla. Hace falta un segundo número para distinguir esas dos situaciones, y ese número es la varianza.

Ejemplo 4.3 (exponencial). Si X tiene densidad f(x) = \lambda e^{-\lambda x} para x \ge 0 (lección 3), E[X] = \int_0^\infty x\,\lambda e^{-\lambda x}\,dx = \frac{1}{\lambda}, integrando por partes. Con \lambda = 2 eventos por hora, el tiempo esperado entre eventos es media hora.

Proposición 4.4 (linealidad). Para constantes a, b y variables aleatorias X, Y con esperanza finita:

  1. E[aX + b] = a\,E[X] + b.
  2. E[X + Y] = E[X] + E[Y].

La segunda igualdad vale sin ninguna hipótesis sobre la relación entre X e Y.

Demostración. Se escribe el caso continuo; el discreto es idéntico con sumas en lugar de integrales.

  1. Por definición y porque la integral es lineal: E[aX + b] = \int (ax + b)\,f(x)\,dx = a\int x\,f(x)\,dx + b\int f(x)\,dx = a\,E[X] + b, donde se usó que \int f(x)\,dx = 1 (la densidad integra a uno).

  2. Sea f(x, y) la densidad conjunta de (X, Y). Por la misma linealidad, E[X + Y] = \iint (x + y)\,f(x,y)\,dx\,dy = \iint x\,f(x,y)\,dx\,dy + \iint y\,f(x,y)\,dx\,dy. En la primera integral, integrar f(x, y) respecto a y da la densidad marginal f_X(x), y queda \int x f_X(x)\,dx = E[X]. La segunda da E[Y] por el mismo argumento. En ningún paso se necesitó que X e Y fueran independientes.

La segunda parte es más fuerte de lo que parece. La esperanza de una suma es siempre la suma de las esperanzas, aunque las variables estén relacionadas de cualquier manera. Para la varianza esto no será cierto (Proposición 4.7).

2. Varianza y desviación estándar

Definición 4.5 (varianza y desviación estándar). Con \mu = E[X], \text{Var}(X) = E\big[(X - \mu)^2\big], \qquad \sigma = \sqrt{\text{Var}(X)}.

La varianza es la esperanza de la desviación al cuadrado respecto a la media. Al elevar al cuadrado, las desviaciones positivas y negativas no se cancelan y las grandes pesan más que las pequeñas. Sus unidades son las de X al cuadrado; la desviación estándar \sigma recupera las unidades originales, y por eso es la que se reporta.

Cada punto dibuja un cuadrado cuyo lado es su distancia a la media, así que su área es (x_i - \mu)^2. La varianza es el área media de esos cuadrados; la desviación estándar, el lado del cuadrado promedio.

Arrastra los puntos

En el preajuste Con un atípico, un solo punto lejano aporta la mayor parte del área total. Elevar al cuadrado hace que las desviaciones grandes pesen mucho más que las pequeñas, y esa es la razón por la que una sola observación extrema puede dominar la varianza de toda la muestra.

Proposición 4.6 (traslación y escala). Para constantes a, b: \text{Var}(aX + b) = a^2\,\text{Var}(X), \qquad \sigma_{aX+b} = |a|\,\sigma_X.

Demostración. Sea Y = aX + b. Por la Proposición 4.4, E[Y] = a\mu + b. Entonces \text{Var}(Y) = E\big[(Y - E[Y])^2\big] = E\big[(aX + b - a\mu - b)^2\big] = E\big[a^2 (X - \mu)^2\big] = a^2\,E\big[(X-\mu)^2\big] = a^2\,\text{Var}(X). La constante b se cancela antes de elevar al cuadrado: desplazar todos los valores no cambia su dispersión. Tomando raíz cuadrada se obtiene la segunda igualdad.

Proposición 4.7 (fórmula alternativa). \text{Var}(X) = E[X^2] - \big(E[X]\big)^2.

Demostración. Se expande el cuadrado dentro de la esperanza y se aplica la linealidad (Proposición 4.4), recordando que \mu es una constante: E\big[(X - \mu)^2\big] = E\big[X^2 - 2\mu X + \mu^2\big] = E[X^2] - 2\mu\,E[X] + \mu^2 = E[X^2] - 2\mu^2 + \mu^2 = E[X^2] - \mu^2.

Esta fórmula es cómoda en cálculos a mano: basta con conocer E[X] y E[X^2]. El apartado siguiente muestra por qué no conviene usarla en un programa.

2.1 La fórmula alternativa en punto flotante

La Proposición 4.7 resta dos cantidades, E[X^2] y \mu^2, que pueden ser muy grandes y casi iguales, para obtener una diferencia pequeña. En aritmética exacta no hay problema. En la computadora, un número de tipo float64 guarda unos 16 dígitos significativos; si E[X^2] y \mu^2 coinciden en sus primeros 15, la resta conserva un solo dígito válido. Esto se llama cancelación catastrófica.

La definición directa, E[(X-\mu)^2], no tiene este problema: primero resta la media a cada valor (las desviaciones son números pequeños) y después eleva al cuadrado.

A partir de una media del orden de 10^8 la columna de la fórmula alternativa deja de aproximarse a 1. Los valores concretos que aparecen ahí dependen de la máquina: cuando un cálculo pierde toda su precisión, lo que queda es ruido de redondeo, y el orden en que cada procesador suma decide qué ruido resulta. Un cálculo correcto da el mismo resultado en todas partes; uno que da resultados distintos en cada máquina está mostrando que se rompió.

Esta situación es frecuente con datos reales: marcas de tiempo, coordenadas geográficas o identificadores numéricos tienen media grande y variación pequeña. La función np.var usa la definición directa. El código escrito a mano puede que no.

3. La media como punto de equilibrio

Si se recorta la gráfica de la densidad en una lámina rígida, la media es el punto en el que la lámina se equilibra sobre un apoyo. Esta no es una analogía: la condición de equilibrio de un cuerpo es \int (x - c)\,f(x)\,dx = 0, cuya solución es c = \mu. Por la misma razón, la varianza coincide con el momento de inercia de la lámina respecto a ese punto.

La mediana, en cambio, es el punto que deja la mitad del área a cada lado. Las dos coinciden en una distribución simétrica y se separan cuando hay una cola: los valores lejanos pesan poco en área pero mucho en palanca, y arrastran la media sin mover la mediana.

Los controles modifican una mezcla de dos distribuciones normales. El triángulo marca la media; la línea punteada, la mediana.

Con el preajuste Cola a la derecha, el 12 % de la masa colocada lejos del centro desplaza la media cerca de un tercio de \sigma respecto a la mediana. Es el mismo fenómeno por el que, en una distribución de ingresos, el ingreso medio queda por encima del ingreso mediano: pocos valores muy altos mueven la media y no la mediana.

4. Varianza de una suma

Proposición 4.8. Para variables aleatorias X, Y con medias \mu_X, \mu_Y: \text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y) + 2\,E\big[(X - \mu_X)(Y - \mu_Y)\big].

Demostración. Por la Proposición 4.4, E[X+Y] = \mu_X + \mu_Y. Entonces \text{Var}(X+Y) = E\Big[\big((X - \mu_X) + (Y - \mu_Y)\big)^2\Big]. Se expande el cuadrado del binomio, (u+v)^2 = u^2 + 2uv + v^2, y se aplica linealidad a los tres términos: = E\big[(X-\mu_X)^2\big] + E\big[(Y-\mu_Y)^2\big] + 2\,E\big[(X-\mu_X)(Y-\mu_Y)\big]. Los dos primeros son \text{Var}(X) y \text{Var}(Y) por definición.

El tercer término se llama covarianza de X e Y y es el objeto de la lección 5. Aquí basta con lo siguiente: la varianza de una suma es la suma de las varianzas solo cuando ese término vale cero, cosa que ocurre, en particular, si X e Y son independientes. La esperanza de una suma no necesitaba esa condición; la varianza sí.

5. De la distribución a la muestra

Hasta aquí se supuso conocida la distribución de X. En la práctica se observan n datos x_1, \dots, x_n y \mu y \sigma^2 son desconocidas. Se estiman.

Definición 4.9 (media y varianza muestrales). Dada una muestra x_1, \dots, x_n, \bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i, \qquad s^2 = \frac{1}{n-1}\sum_{i=1}^{n} (x_i - \bar{x})^2.

La media muestral imita a la Definición 4.1 con peso 1/n para cada dato. La varianza muestral imita a la Definición 4.5, con una diferencia: el denominador es n - 1. La razón es la siguiente proposición.

Proposición 4.10 (la varianza muestral es insesgada). Si x_1, \dots, x_n son observaciones independientes de una variable con media \mu y varianza \sigma^2, entonces E\Big[\sum_{i=1}^{n} (x_i - \bar{x})^2\Big] = (n-1)\,\sigma^2, \qquad\text{y por tanto}\qquad E[s^2] = \sigma^2.

Demostración. Primero, una identidad algebraica que se comprueba expandiendo el cuadrado y usando \sum x_i = n\bar{x}: \sum_i (x_i - \bar{x})^2 = \sum_i x_i^2 - n\,\bar{x}^2. Se toma esperanza en cada término. Para cada dato, por la Proposición 4.7, E[x_i^2] = \sigma^2 + \mu^2. Para la media muestral se necesita su varianza: por independencia, la Proposición 4.8 sin término cruzado da \text{Var}(\sum x_i) = n\sigma^2, y por la Proposición 4.6 con a = 1/n, \text{Var}(\bar{x}) = \sigma^2/n. Aplicando de nuevo la Proposición 4.7, E[\bar{x}^2] = \sigma^2/n + \mu^2. Sustituyendo: E\Big[\sum_i (x_i-\bar{x})^2\Big] = n(\sigma^2 + \mu^2) - n\Big(\frac{\sigma^2}{n} + \mu^2\Big) = n\sigma^2 - \sigma^2 = (n-1)\,\sigma^2. Dividir entre n - 1 deja exactamente \sigma^2.

La interpretación: \bar{x} se calculó con los mismos datos cuya dispersión se quiere medir, así que está más cerca de ellos de lo que estaría la verdadera \mu. Las desviaciones respecto a \bar{x} salen, en promedio, un poco cortas, y dividir entre n subestima \sigma^2 por el factor (n-1)/n. En el lenguaje de la lección 8, el estimador con denominador n tiene sesgo y el de denominador n-1 no lo tiene. En el lenguaje de grados de libertad: al imponer que las desviaciones sumen cero, de n desviaciones solo n - 1 pueden variar libremente.

La simulación siguiente hace visible el argumento. Cada muestra de n = 5 se extrae de una población con \mu = 10 y \sigma^2 = 4, ambas conocidas aquí y desconocidas en la práctica. Para cada muestra se comparan dos sumas: la de las desviaciones respecto a la \mu verdadera y la de las desviaciones respecto a \bar{x}.

n = 5, μ = 10, σ² = 4

Extrae unas cuantas muestras de una en una antes de acumular miles. En casi todas, \bar{x} cae más cerca del grupo de puntos que \mu; en ninguna cae más lejos. Esa asimetría es el sesgo, y la Proposición 4.10 dice exactamente cuánto vale: un factor (n-1)/n, que con n = 5 es 0.8.

La simulación siguiente repite el experimento muchas veces y promedia los dos estimadores.

6. Momentos de orden superior

Definición 4.11 (momentos). El k-ésimo momento de X es E[X^k]; el k-ésimo momento central es E[(X-\mu)^k]; el k-ésimo momento estandarizado es E\big[\big(\tfrac{X-\mu}{\sigma}\big)^k\big].

La media es el primer momento y la varianza el segundo momento central. Los dos siguientes describen la forma:

Momento estandarizado Nombre Qué describe
k = 3 asimetría \gamma_1 Hacia qué lado se extiende la cola. Cero si la distribución es simétrica.
k = 4 curtosis \gamma_2 Cuánta masa hay en las colas. Se reporta en exceso, restando el valor 3 de la normal.

Estandarizar —restar \mu y dividir entre \sigma— elimina las unidades y la escala: dos distribuciones con la misma forma tienen la misma asimetría y la misma curtosis aunque una esté en gramos y otra en kilos. Por ejemplo, toda distribución exponencial tiene \gamma_1 = 2, sea cual sea \lambda.

Ejercicios

Ejercicio 1 — Varianza muestral

Implementar s^2 según la Definición 4.9, centrando primero. El parámetro ddof es el número que se resta a n en el denominador.

Restar la media, elevar al cuadrado, sumar, y dividir entre n - ddof: ((x - x.mean())**2).sum() / (n - ddof). No usar (x**2).mean() - x.mean()**2 (apartado 2.1).

Ejercicio 2 — Asimetría

Implementar \gamma_1 según la Definición 4.11 con k = 3, usando la desviación estándar poblacional (ddof=0, que es el valor por defecto de x.std()).

z es la variable estandarizada: (x - x.mean()) / x.std().

Reto

En proyectos/notebooks/F1-retos.ipynb, sección Est 04:

  1. Implementar resumen(x) que devuelva media, varianza, asimetría y curtosis en una sola pasada por los datos (algoritmo de Welford). Comparar con NumPy y medir el tiempo frente a la versión de varias pasadas.
  2. Reproducir la tabla del apartado 2.1 variando también n. Determinar a partir de qué combinación de media y n la fórmula alternativa deja de ser fiable, y graficar esa frontera.
  3. Para una distribución de Pareto con \alpha = 1.5 (lección 3), calcular la media muestral con n = 10, 10^2, \dots, 10^6, repitiendo 200 veces cada n, y graficar la dispersión de esas medias. Con \alpha < 2 la varianza teórica es infinita: describir qué ocurre con la convergencia de \bar{x}.

Del libro

Think Stats se publica bajo licencia CC BY-NC-SA 4.0, lo que permite citarlo textualmente. Las citas van en su idioma original; la glosa en español es mía.

Variance is a statistic that quantifies the spread of a set of values. It is the mean of the squared deviations, which are the distances of each point from the mean.

Downey, Think Stats 3e, §1.6 Summary Statistics

Es la Definición 4.5 en versión muestral, con denominador n. Downey no usa n - 1 en ese capítulo; la Proposición 4.10 explica qué se pierde con esa elección y por qué es pequeño cuando n es grande.

A better option is the standard deviation, which is the square root of variance.

Downey, Think Stats 3e, §1.6

“Better” se refiere a que la varianza está en unidades al cuadrado y por eso “is useful in some computations, but not a good way to describe a dataset”, en palabras del mismo apartado.

Informally, values that are one or two standard deviations from the mean are common – values farther from the mean are rare.

Downey, Think Stats 3e, §1.6

Esta regla informal es exacta para la normal (68 % dentro de \mu \pm \sigma, 95 % dentro de \mu \pm 2\sigma) y solo aproximada para otras distribuciones; para colas pesadas puede fallar por completo, como se ve en el reto 3.

Preguntas para leer §1.6 y MML §6.4 con lápiz:

  1. Downey define la varianza dividiendo entre n. Localizar la línea de código exacta y reescribirla con denominador n - 1. ¿En cuánto cambia el resultado con los datos del capítulo?
  2. MML §6.4 Summary Statistics and Independence define la esperanza para variables discretas y continuas. Comparar esa definición con la 4.1 de aquí: ¿qué notación usa el libro para la función de masa?
  3. El mismo apartado de MML define la independencia estadística. Escribir con símbolos qué relación exige entre la distribución conjunta y las marginales, y contrastarla con la condición “covarianza cero” de la Proposición 4.8.
Note

Esta lección no cita textualmente a MML porque no se pudo extraer el texto del PDF de forma verificable. Las referencias a §6.4 son a nivel de sección, con el título comprobado contra el índice de la editorial.

Para el Cerebro

Nota nueva en 10-Conceptos/esperanza-varianza.md, enlazada a [[distribuciones-analiticas]] y, más adelante, a [[covarianza-correlacion]]. Registrar en 50-Errores/ la regla: centrar antes de elevar al cuadrado.

¿Qué es la esperanza de una variable aleatoria?::El promedio de sus valores ponderado por su probabilidad: Σ x·p(x) o ∫ x·f(x) dx
¿La esperanza de X es necesariamente un valor que X puede tomar?::No: E[dado] = 3.5
¿Es lineal la esperanza?::Sí, siempre: E[aX+b] = aE[X]+b y E[X+Y] = E[X]+E[Y] sin independencia
¿Cómo se define la varianza?::Var(X) = E[(X − μ)²], la esperanza de la desviación al cuadrado
¿Qué le pasa a la varianza con aX + b?::Var(aX+b) = a²Var(X): el desplazamiento no cuenta, la escala entra al cuadrado
¿Cuál es la fórmula alternativa de la varianza?::Var(X) = E[X²] − (E[X])²
¿Por qué no usar la fórmula alternativa en un programa?::Cancelación catastrófica: resta dos números grandes casi iguales y pierde los dígitos significativos
¿Cuándo es Var(X+Y) = Var(X) + Var(Y)?::Cuando el término cruzado E[(X−μₓ)(Y−μᵧ)] es cero, en particular si son independientes
¿Por qué s² divide entre n − 1?::Porque E[Σ(xᵢ − x̄)²] = (n − 1)σ²: x̄ se estimó con los mismos datos
¿Qué es un estimador insesgado?::Uno cuya esperanza coincide con la cantidad que estima
¿Qué es el k-ésimo momento estandarizado?::E[((X − μ)/σ)ᵏ]
¿Qué mide la asimetría?::El tercer momento estandarizado: hacia qué lado se extiende la cola
¿Cuánto vale la asimetría de una exponencial?::2, para cualquier λ

Fuentes

Lo que esta página demuestra sola. El cociente (n-1)/n de la Proposición 4.10 y la cancelación catastrófica del apartado 2.1 son simulaciones que se ejecutan en el navegador al abrir la página. Las demostraciones de las Proposiciones 4.4 a 4.10 se comprueban paso a paso con lápiz.

Lo que viene de los libros.

  • Think Stats 3e (Downey, CC BY-NC-SA 4.0), §1.6 Summary Statistics — citado textualmente arriba.
  • Mathematics for Machine Learning (Deisenroth, Faisal & Ong, CUP 2020), §6.4 Summary Statistics and Independence — referencia a nivel de sección; sin cita textual.

Lo que es mío, no del libro. La numeración de definiciones y proposiciones es de esta lección, no de los libros. La imagen del punto de equilibrio y el momento de inercia es un hecho físico exacto, pero ninguno de los dos libros lo plantea así. Asimetría y curtosis no aparecen en Think Stats 3e: estaban en la 2ª edición y se quitaron.

Índices verificados el 11-09-2026 contra el índice publicado de cada libro.

→ Siguiente: Covarianza y correlación