Población, muestra y variable aleatoria
Estadística · Lección 1
Objetivo
Al terminar esta lección se puede:
- Distinguir población de muestra, y parámetro de estadístico.
- Definir variable aleatoria y distribución, y decir por qué se escriben X y x con grafías distintas.
- Explicar por qué la media muestral cambia de una muestra a otra, y describir cómo se reparten esos valores.
- Predecir cuánto se encoge esa variación al aumentar n, y comprobarlo por simulación.
De dónde viene
Ninguna. Es la primera lección del módulo y solo usa aritmética: sumas, promedios y raíces cuadradas.
Para qué sirve después
- Lección 2: la distribución de la Definición 1.4 se escribe de tres formas distintas —función de masa, densidad y acumulada—, y cada una sirve para algo.
- Lección 4: aquí se observa que \bar{x} ronda a \mu y que su dispersión baja como 1/\sqrt{n}; allí se demuestra, con las reglas de esperanza y varianza.
- Lección 7: el teorema central del límite describe la forma exacta de la distribución muestral que aquí se dibuja a mano.
- Lección 8: sesgo y varianza de un estimador; \bar{x} es el primer estimador del curso.
- Lección 11: una prueba de hipótesis compara una diferencia observada contra la variación que el muestreo produce por sí solo. Sin esta lección, esa comparación no tiene sentido.
Notación
| Símbolo | Se lee | Significado |
|---|---|---|
| X | equis mayúscula | Una variable aleatoria: la cantidad antes de observarla |
| x | equis minúscula | Un valor concreto, ya observado |
| x_i | equis sub i | El i-ésimo dato de la muestra, con i = 1, \dots, n |
| n | ene | Tamaño de la muestra: cuántos datos se observaron |
| N | ene mayúscula | Tamaño de la población, casi siempre desconocido o infinito |
| \mu | mu | La media de la población. Un parámetro: fijo y desconocido |
| \sigma | sigma | La desviación estándar de la población. También un parámetro |
| \bar{x} | equis barra | La media de la muestra. Un estadístico: se calcula y cambia con cada muestra |
| s | ese | La desviación estándar de la muestra |
| X \sim F | equis se distribuye como efe | X tiene la distribución F |
La regla de grafías es constante en todo el módulo: letras griegas para lo que no se conoce, letras latinas para lo que se calcula. \mu y \sigma describen la población y nunca se observan; \bar{x} y s se obtienen de los datos que sí hay.
1. Población y muestra
Definición 1.1 (población). El conjunto completo de unidades sobre las que se quiere concluir algo.
Definición 1.2 (muestra). Un subconjunto de la población, del que sí se observan los valores.
La población casi nunca se observa entera. Puede ser demasiado grande, puede no existir todavía —los pacientes que llegarán el año que viene— o puede que observarla destruya las unidades, como al medir cuánto aguanta un cable antes de romperse.
Definición 1.3 (parámetro y estadístico). Un parámetro es un número que describe a la población: \mu, \sigma. Un estadístico es un número calculado a partir de la muestra: \bar{x}, s.
Toda la estadística inferencial consiste en usar estadísticos para decir algo sobre parámetros. La distinción es la más importante del módulo, y también la que más se pierde de vista: es fácil escribir “la media” sin precisar de cuál de las dos se habla.
The set of values and how frequently each value appears in a dataset.
Downey, Think Stats 3e, §2.7 Glossary, definición de distribution
Esa definición es la de la distribución de un conjunto de datos, es decir, de una muestra. Más abajo se define la de una variable aleatoria, que es su análogo para la población.
2. Variable aleatoria y distribución
Definición 1.4 (variable aleatoria). Una función que asigna un número a cada resultado posible de un experimento aleatorio. Se escribe con mayúscula, X; el valor que toma en una realización concreta se escribe con minúscula, x.
La mayúscula nombra el mecanismo; la minúscula, el resultado. “La estatura de una persona elegida al azar de esta población” es X: una regla que producirá un número en cuanto se elija a alguien, y no el número mismo. Una vez elegida, “1.74 m” es x.
Definición 1.5 (distribución). La descripción completa de qué valores puede tomar X y con qué probabilidad. Se escribe X \sim F.
La distribución es un objeto de la población, no de los datos. Los datos permiten estimarla, y esa estimación mejora al crecer n.
El control siguiente extrae una muestra de la distribución elegida. La curva oscura es la distribución verdadera, que en la vida real no se ve; las barras son la muestra.
Con n = 10 el histograma no se parece a la curva; con n = 5000 la sigue de cerca. Esa es la primera idea del módulo: la muestra informa sobre la población, y el grado en que lo hace depende de n.
Con la log-normal, la media de la población queda a la derecha del máximo de la curva, porque la cola larga la desplaza. La lección 4 explica por qué.
3. El estadístico también es aleatorio
Si la muestra es aleatoria, todo lo calculado a partir de ella también lo es. \bar{x} es entonces una variable aleatoria con su propia distribución, y no un número fijo.
Definición 1.6 (distribución muestral). La distribución de un estadístico considerado como variable aleatoria, es decir, cómo se reparten sus valores al repetir el muestreo muchas veces sobre la misma población.
Cuesta verlo porque en la práctica solo se extrae una muestra. La simulación permite hacer lo que la realidad no deja: repetir el experimento miles de veces y mirar cómo se reparte el resultado.
Dos hechos que conviene extraer de ahí, porque gobiernan todo lo que viene:
- El histograma de las \bar{x} se centra en \mu. Las medias muestrales no se desvían sistemáticamente hacia ningún lado. En la lección 8 esto recibe un nombre: \bar{x} es un estimador insesgado de \mu.
- Es más estrecho que la población, y se estrecha al crecer n. Cambia n de 2 a 100 y compara la lectura con \sigma/\sqrt{n}: coinciden.
4. La ley de la raíz de n
La dispersión de \bar{x} recibe un nombre propio porque se usa constantemente.
Definición 1.7 (error estándar). La desviación estándar de la distribución muestral de un estadístico. Para la media de n observaciones independientes de una población con desviación \sigma: \text{EE}(\bar{x}) = \frac{\sigma}{\sqrt{n}}.
Esta fórmula no se demuestra aquí. Requiere las reglas de varianza de una suma y de un producto por una constante, que son las Proposiciones 4.6 y 4.8 de la lección 4. Aquí se comprueba por simulación; allí se deriva en tres líneas.
Lo que sí se puede leer de inmediato es la forma de la dependencia. Como n entra bajo una raíz:
| Para dividir el error entre | hay que multiplicar n por |
|---|---|
| 2 | 4 |
| 3 | 9 |
| 10 | 100 |
La precisión se compra cara. Pasar de 100 a 400 observaciones reduce el error a la mitad; para reducirlo a la mitad otra vez hacen falta 1600. Esta curva de rendimientos decrecientes decide el tamaño de casi cualquier estudio.
Las dos columnas coinciden en cada fila. La simulación no demuestra la fórmula, pero muestra que se cumple con exactitud y no de forma aproximada.
5. Variables discretas y continuas
Definición 1.8. Una variable aleatoria es discreta si sus valores posibles se pueden enumerar (finitos o infinitos numerables), y continua si toma cualquier valor de un intervalo.
La diferencia no es cosmética: cambia cómo se escribe la distribución. Para una discreta tiene sentido preguntar P(X = x) y la respuesta suele ser positiva. Para una continua, P(X = x) = 0 para todo x, porque hay infinitos valores posibles; solo tienen probabilidad no nula los intervalos. La lección 2 desarrolla las dos herramientas que esto obliga a distinguir.
Ejercicios
Ejercicio 1 — Error estándar de la media
Calcular el error estándar de \bar{x} según la Definición 1.7, a partir de una muestra.
\sigma no se conoce, así que se sustituye por s, la desviación muestral: x.std(ddof=1). El error estándar es esa desviación dividida entre \sqrt{n}.
Ejercicio 2 — La media muestral no se desvía
Comprobar por simulación que la media de las \bar{x} coincide con \mu. Devolver esa media sobre 50 000 muestras.
X tiene una muestra por fila. Promediar dentro de cada fila es X.mean(axis=1): axis=1 recorre las columnas y deja un valor por fila.
Reto
En proyectos/notebooks/F0-retos.ipynb, sección Est 01:
- Escribir
simular_medias(dist, n, reps)que devuelva las medias muestrales y verificar la ley de 1/\sqrt{n} para la normal, la exponencial y la uniforme. Graficar la dispersión observada contra \sigma/\sqrt{n} en ejes log-log: debe salir una recta de pendiente -1/2. - Repetir con una distribución de Cauchy (
rng.standard_cauchy). La ley falla: describir qué ocurre con la dispersión de las medias al crecer n y buscar cuál de las hipótesis de la Definición 1.7 no se cumple. - Tomar un conjunto de datos público con al menos 10 000 filas, tratarlo como población, y extraer de él muestras de tamaño creciente. Comparar la media muestral con la de la población completa y comprobar cuántas observaciones hacen falta para que el error baje de un umbral fijado de antemano.
Del libro
Think Stats se publica bajo licencia CC BY-NC-SA 4.0, que permite citarlo textualmente. Las citas van en su idioma original.
The most frequent quantity in a sample, or one of the most frequent quantities.
Downey, Think Stats 3e, §2.7 Glossary, definición de mode
La moda es el tercer resumen de posición, junto con la media y la mediana. A diferencia de las otras dos, puede haber más de una, y de ahí el “o una de las más frecuentes” de la definición.
Preguntas para leer §1 y §2 con lápiz:
- §1.2 describe la encuesta que se usa en todo el libro. ¿A qué población pretende representar, cuántos embarazos incluye y en qué periodo se levantó?
- §2.3 se titula Outliers. ¿Qué valores extremos encuentra en la duración del embarazo, y qué criterio propone para decidir si son errores de medición o casos reales?
- §2.4 compara los primeros nacimientos con los demás y §2.5 introduce el tamaño del efecto. ¿Por qué no basta con decir que dos grupos tienen medias distintas?
Para el Cerebro
Nota nueva en 10-Conceptos/poblacion-muestra.md, enlazada a la que escribirás sobre [[esperanza-varianza]]. Anotar la regla de grafías: griegas para parámetros, latinas para estadísticos.
¿Qué es una población?::El conjunto completo de unidades sobre las que se quiere concluir algo
¿Qué es un parámetro?::Un número que describe a la población, como μ o σ: fijo y desconocido
¿Qué es un estadístico?::Un número calculado a partir de la muestra, como x̄ o s: cambia con cada muestra
¿Por qué X va en mayúscula y x en minúscula?::X es la variable aleatoria, el mecanismo; x es un valor ya observado
¿Qué es una distribución?::La descripción completa de qué valores puede tomar X y con qué probabilidad
¿Qué es la distribución muestral de un estadístico?::Cómo se reparten sus valores al repetir el muestreo muchas veces sobre la misma población
¿Qué es el error estándar de la media?::La desviación estándar de x̄ entre muestras: σ/√n
¿Cuánto hay que aumentar n para reducir el error a la mitad?::Multiplicarlo por 4, porque n entra bajo una raíz
¿Se desvía la media muestral hacia algún lado?::No: la media de las x̄ coincide con μ
¿Cuál es la diferencia entre discreta y continua?::La discreta tiene valores enumerables; la continua toma cualquier valor de un intervalo
¿Cuánto vale P(X = x) para una variable continua?::Cero: solo los intervalos tienen probabilidad no nula
Fuentes
Lo que esta página demuestra sola. La convergencia del histograma a la densidad, la distribución muestral de \bar{x} y la coincidencia entre su dispersión y \sigma/\sqrt{n} se calculan en el navegador al abrir la página.
Lo que viene de los libros.
- Think Stats 3e (Downey, CC BY-NC-SA 4.0), §1 Exploratory Data Analysis y §2 Distributions — citado textualmente arriba.
Lo que es mío, no del libro. La numeración de definiciones es de esta lección. La Definición 1.7 se enuncia sin demostrar: la demostración necesita las Proposiciones 4.6 y 4.8 de la lección 4, y adelantarla aquí obligaría a usar resultados aún no establecidos. La tabla de rendimientos decrecientes y la regla de grafías griegas/latinas son forma de presentarlo, no contenido de la fuente.
Índices verificados el 12-09-2026 contra el índice publicado del libro.
→ Siguiente: PMF, CDF y funciones de distribución