Datos faltantes: MCAR, MAR y MNAR

Estadística · Lección 15

L3 Derivación Fase F1 Libro McKinney §7.1 Prereqs Covarianza y correlación · Inferencia sobre los coeficientes

Objetivo

Al terminar esta lección se puede:

  1. Escribir el hecho de que un dato falte como una variable aleatoria más, y distinguir los tres mecanismos clásicos: MCAR, MAR y MNAR.
  2. Demostrar que el sesgo del análisis de casos completos es exactamente una covarianza reescalada, y deducir de ahí qué mecanismo daña qué cantidad.
  3. Demostrar que rellenar los huecos con la media conserva la media y encoge la varianza por un factor conocido, y medir cuánta cobertura se pierde por eso.
  4. Explicar por qué bajo MNAR no hay estimador que sirva —el obstáculo es de identificabilidad y no de método— y calcular las cotas que los datos sí imponen.

De dónde viene

  • Estadística 5: la covarianza y su definición \text{Cov}(X,Y)=E[(X-\mu_X)(Y-\mu_Y)]. La Proposición 15.5 la usa con una variable que vale 0 o 1, y con eso el sesgo por no respuesta deja de ser una intuición y pasa a ser una fórmula.
  • Estadística 9: la cobertura de un intervalo de confianza y qué significa que se quede corta (Proposición 9.7). La Proposición 15.10 vuelve a medirla, ahora rota por la imputación y no por el cuantil.
  • Estadística 13 y 14: el modelo y_i=\beta_0+\beta_1x_i+\varepsilon_i, el estimador \hat\beta_1 y su varianza \sigma^2/\text{SCX}. Aquí se pregunta qué le pasa a los dos cuando parte de las filas no llega.
  • Estadística 7: insesgadez y error cuadrático medio, para poder decir con precisión qué se rompe y qué solo se encarece.

Para qué sirve después

  • Lección 16: una curva de calibración se construye con los casos que tienen etiqueta; si la etiqueta falta de forma no aleatoria, la curva miente antes de empezar.
  • Lección 17: descartar filas hasta que el resultado salga significativo es una de las formas más comunes de p-hacking, y se detecta comparando el n de cada análisis.
  • McKinney §7.1 Handling Missing Data: dropna y fillna son exactamente las dos operaciones que esta lección evalúa. Saber cuál usar es esta lección; saber cómo usarlas es ese capítulo.
  • Aprendizaje automático: toda tubería de preparación de datos imputa algo. El error estándar que reporta el modelo entrenado sobre datos imputados hereda el problema de la Proposición 15.9.

Notación

Símbolo Se lee Significado
n ene Tamaño de la muestra, filas incluidas las que tienen huecos
R_i erre sub i Indicador de respuesta: vale 1 si y_i se observa y 0 si falta. Solo en esta lección; en Matemática 7, R es la matriz triangular de A=QR
m eme Número de casos completos, m=\sum_i R_i. Es aleatorio: depende de quién responda
q(x) cu de equis Propensión de respuesta, P(R=1\mid X=x); q a secas es P(R=1). La literatura suele escribirla \pi(x) o e(x); aquí no, porque en este sitio \pi ya es 3,1416 y e ya es un residuo
\bar{y}_{\text{obs}} y barra observada Media de los m casos completos, \frac{1}{m}\sum_i R_iy_i
\tilde{y} y tilde El vector de n valores después de rellenar los huecos
\mu(x) mu de equis E[Y\mid X=x], la media condicional que la regresión de la lección 13 estima

El símbolo R de esta tabla se usa aquí con un sentido distinto del que tiene en Matemática 7, así que está declarado arriba y no en el glosario del sitio: un símbolo entra al glosario global solo si significa lo mismo en todas las páginas. Por la misma razón la propensión se escribe q(x) y no \pi(x), que es lo habitual fuera de aquí: \pi ya está tomado.

1. Que un dato falte es un dato

El primer movimiento es dejar de ver los huecos como un accidente de la tabla y verlos como una variable aleatoria más, que tiene su propia distribución y que puede estar relacionada con todo lo demás.

Definición 15.1 (indicador de respuesta). Para cada unidad i de la muestra, sea R_i = \begin{cases} 1 & \text{si } y_i \text{ se observa},\\ 0 & \text{si falta}.\end{cases} El vector (R_1,\dots,R_n) es el patrón de faltantes. Los datos que llegan al análisis son los pares (R_i,\, R_iy_i) y las covariables x_i, que se suponen siempre observadas. Se escribe q(x) = P(R=1\mid X=x) para la propensión de respuesta.

La clasificación clásica ordena los mecanismos por cuánta información usa la moneda que decide si el dato llega.

Definición 15.2 (MCAR). El mecanismo es missing completely at random si P(R=1 \mid X, Y) = P(R=1) para todo valor de X y de Y: la probabilidad de responder es la misma para todos.

Definición 15.3 (MAR). El mecanismo es missing at random si P(R=1 \mid X, Y) = P(R=1 \mid X) = q(X), es decir, si depende solo de cantidades observadas. Dos unidades con el mismo x tienen la misma probabilidad de responder, valga lo que valga su y.

Definición 15.4 (MNAR). El mecanismo es missing not at random si no es MAR: P(R=1\mid X,Y) sigue dependiendo de Y aun fijando X.

El nombre MAR es desafortunado y conviene decirlo una vez: «al azar» sugiere que no hay estructura, y lo que MAR afirma es que la estructura está dentro de lo que se ve. MCAR es el caso sin estructura ninguna. La diferencia entre MAR y MNAR no se puede comprobar con los datos —eso es la sección 4—, así que declarar uno u otro es siempre un supuesto, no un hallazgo.

El visual siguiente sortea una población de ingresos y años de educación, y deja fuera la misma fracción de casos con los tres mecanismos, de modo que lo único que los distingue es quiénes faltan.

La recta oscura es la de la población y no se mueve nunca; la punteada es a dónde tiende el ajuste hecho solo con los casos completos. Con MCAR las dos coinciden. Con MAR la media observada se despega pero la recta no. Con MNAR se despegan las dos. La sección siguiente demuestra por qué.

2. Qué sobrevive a cada mecanismo

Todo el daño que hace la no respuesta a una media cabe en una covarianza.

Proposición 15.5 (el sesgo del caso completo). Si P(R=1)>0, entonces E[Y\mid R=1] - E[Y] \;=\; \frac{\text{Cov}(Y,R)}{P(R=1)}.

Demostración. Sea q = P(R=1) = E[R], usando que R solo toma los valores 0 y 1. Como YR vale Y cuando R=1 y 0 cuando R=0, E[YR] = E[Y \mid R=1]\,P(R=1) = q\,E[Y\mid R=1]. Con la definición de covarianza de la lección 5, \text{Cov}(Y,R) = E[YR] - E[Y]E[R] = q E[Y\mid R=1] - q E[Y] = q\big(E[Y\mid R=1] - E[Y]\big). Dividiendo entre q>0 queda la identidad.

La lectura es la que organiza toda la lección: la media de los casos completos es insesgada si y solo si el hecho de responder no covaría con lo que se mide. No hace falta que responder sea independiente de todo; basta con que sea incorrelado con Y. Y el tamaño del sesgo no depende de cuántos faltan sino de cuánto covarían: con q chico, una covarianza pequeña se amplifica al dividir.

Proposición 15.6 (MCAR: menos datos, nada más). Bajo MCAR, con (R_i) independientes entre sí e independientes de los datos y P(R=1)=q:

  1. \text{Cov}(Y,R)=0 y por tanto E[\bar{y}_{\text{obs}}\mid m]=\mu para todo m\ge 1;
  2. \text{Var}(\bar{y}_{\text{obs}}\mid m) = \sigma^2/m, con E[m]=nq.

Demostración. (1) MCAR dice P(R=1\mid Y)=P(R=1), es decir, R es independiente de Y, y variables independientes tienen covarianza cero; por la Proposición 15.5, E[Y\mid R=1]=E[Y]=\mu. Más aún, la densidad condicional cumple f(y\mid R=1) = \frac{f(y)P(R=1\mid Y=y)}{P(R=1)} = \frac{f(y)q}{q} = f(y), así que cada valor observado sigue teniendo la distribución de la población. (2) Condicionando en el patrón de faltantes, los m valores observados son independientes con esa misma distribución —la independencia de los R_i respecto de los datos es lo que impide que seleccionar cambie la ley conjunta—, de modo que \bar{y}_{\text{obs}} es la media de una muestra de tamaño m: media \mu y varianza \sigma^2/m. Como m=\sum_iR_i es binomial de parámetros n y q, E[m]=nq.

MCAR no es un problema de sesgo sino de precio: donde había n datos hay nq, y el error estándar sube por el factor 1/\sqrt{q}. Con 40 % de no respuesta, la muestra efectiva es el 60 % y el error estándar sube un 29 %.

Bajo MAR la media marginal ya no sobrevive, pero algo más importante sí.

Proposición 15.7 (MAR: lo condicional se conserva). Bajo MAR, para todo x con q(x)>0, f(y \mid X=x,\, R=1) = f(y\mid X=x). En consecuencia, cualquier cantidad que dependa solo de la ley de Y dado X —en particular \beta_0 y \beta_1 del modelo de la Definición 13.1— se puede estimar sin sesgo con los casos completos, mientras que la media marginal queda sesgada en E[Y\mid R=1]-E[Y] = \frac{\text{Cov}\big(\mu(X),\,q(X)\big)}{E[q(X)]}.

Demostración. Por la regla de Bayes aplicada dentro del estrato X=x, f(y\mid x, R=1) = \frac{f(y\mid x)\,P(R=1\mid X=x, Y=y)}{P(R=1\mid X=x)} = \frac{f(y\mid x)\,q(x)}{q(x)} = f(y\mid x), donde el paso central es exactamente la Definición 15.3. Para la consecuencia sobre la regresión: la demostración de la Proposición 14.2 escribe \hat\beta_1 = \beta_1 + \sum_i c_i\varepsilon_i condicionando en los x_i, y solo necesita que E[\varepsilon_i\mid x_i]=0 en la submuestra que se usa. Bajo MAR, seleccionar con probabilidad q(x_i) no cambia la ley de \varepsilon_i dado x_i —es lo que acaba de demostrarse—, así que esa esperanza sigue siendo cero y E[\hat\beta_1]=\beta_1: la selección altera qué valores de x aparecen, no qué pasa dentro de cada uno.

Para la media marginal, aplíquese la Proposición 15.5 con la torre de esperanzas: \text{Cov}(Y,R) = E[YR]-E[Y]E[R] y E[YR] = E\big[E[YR\mid X]\big] = E[\mu(X)q(X)], mientras E[R]=E[q(X)], de donde \text{Cov}(Y,R)=\text{Cov}(\mu(X),q(X)).

Esto explica el visual: bajo MAR la recta punteada se queda encima de la oscura porque la Proposición 15.7 lo obliga, y la media se va porque la covarianza entre «cuánto se gana en promedio con esa educación» y «con qué probabilidad responde quien tiene esa educación» no es cero.

Si el sesgo viene de que unos estratos están sobrerrepresentados, la reparación es devolverles su peso.

Proposición 15.8 (reponderación por el inverso de la propensión). Bajo MAR y con positividadq(x) \ge q_{\min} > 0 para todo x del soporte—, E\!\left[\frac{R\,Y}{q(X)}\right] = E[Y].

Demostración. Condicionando en (X,Y) y usando que E[R\mid X,Y]=P(R=1\mid X,Y)=q(X) por MAR, E\!\left[\frac{RY}{q(X)}\right] = E\!\left[\frac{Y}{q(X)}\,E[R\mid X,Y]\right] = E\!\left[\frac{Y\,q(X)}{q(X)}\right] = E[Y]. La positividad es lo que hace legítima la división: si hubiera un valor de x con q(x)=0, esa parte de la población nunca aparece en la muestra y ningún peso la puede resucitar.

La condición de positividad merece atención porque es la que falla en la práctica con más frecuencia que el propio supuesto MAR: si nadie con menos de seis años de educación responde jamás, no hay reponderación que arregle nada, y lo honesto es decir que la estimación vale para la población en la que sí hay respuesta.

La simulación siguiente mide los tres mecanismos sobre la misma población: para cada uno, el sesgo de la media de casos completos y el de la pendiente.

Las tres filas son las tres definiciones, medidas. Con MCAR los dos sesgos son indistinguibles de cero. Con MAR la media se va en +57 —más del 3 % de \mu_Y— y la pendiente no se mueve, que es la Proposición 15.7 en números. Con MNAR se mueven las dos: la media cae 75 unidades y la pendiente pierde más de dos.

La reponderación de la Proposición 15.8 arregla la media bajo MAR, y hay que pagarla en varianza.

El sesgo de +57{,}89 desaparece: queda +0{,}61 con un error de Monte Carlo de 0{,}43, es decir, ruido de simulación. El precio está en la última línea: la desviación típica del estimador reponderado es mayor que la del crudo. Reponderar cambia sesgo por varianza, y esa es la misma moneda de la lección 7.

3. Rellenar los huecos

Borrar las filas incompletas tiene un costo evidente —se pierden también las columnas que sí estaban— y por eso la reacción habitual es rellenar. La imputación más simple es poner en cada hueco la media de lo observado. Conserva exactamente la cantidad que uno quería estimar y destruye la que mide la incertidumbre.

Proposición 15.9 (qué le hace a la varianza rellenar con la media). Sea \tilde{y} el vector de n valores que resulta de poner \bar{y}_{\text{obs}} en cada hueco, y sean s^2_{\text{obs}} y s^2_{\tilde{y}} las varianzas muestrales (con divisor m-1 y n-1) de los observados y del vector completado. Entonces \bar{\tilde{y}} = \bar{y}_{\text{obs}}, \qquad s^2_{\tilde{y}} = \frac{m-1}{n-1}\,s^2_{\text{obs}}.

Demostración. La suma de los n valores es \sum_i R_iy_i + (n-m)\bar{y}_{\text{obs}} = m\bar{y}_{\text{obs}} + (n-m)\bar{y}_{\text{obs}} = n\bar{y}_{\text{obs}}, de donde \bar{\tilde{y}} = \bar{y}_{\text{obs}}. Como la media del vector completado coincide con \bar{y}_{\text{obs}}, cada valor imputado tiene desviación exactamente cero respecto de ella, y la suma de cuadrados no cambia: \sum_{i=1}^{n}(\tilde{y}_i - \bar{\tilde{y}})^2 = \sum_{i:R_i=1}(y_i-\bar{y}_{\text{obs}})^2 + (n-m)\cdot 0 = (m-1)s^2_{\text{obs}}. Dividiendo entre n-1 queda el resultado.

Proposición 15.10 (y qué le hace al intervalo). Con la misma notación, el error estándar que reporta el conjunto completado es \frac{s_{\tilde{y}}}{\sqrt{n}} = \sqrt{\frac{m(m-1)}{n(n-1)}}\;\cdot\;\frac{s_{\text{obs}}}{\sqrt{m}} \;\approx\; \frac{m}{n}\cdot\frac{s_{\text{obs}}}{\sqrt{m}}, donde el segundo factor es el error estándar correcto de \bar{y}_{\text{obs}}. El intervalo construido con él es, por tanto, aproximadamente m/n veces más angosto de lo que debería, y su cobertura cae por debajo del nivel nominal aunque el mecanismo sea MCAR.

Demostración. Por la Proposición 15.9, s_{\tilde{y}} = s_{\text{obs}}\sqrt{(m-1)/(n-1)}. Entonces \frac{s_{\tilde{y}}}{\sqrt{n}} = s_{\text{obs}}\sqrt{\frac{m-1}{n(n-1)}} = \sqrt{\frac{m(m-1)}{n(n-1)}}\cdot\frac{s_{\text{obs}}}{\sqrt{m}}, multiplicando y dividiendo por \sqrt{m}. Para m y n grandes, \sqrt{m(m-1)/(n(n-1))}\approx m/n. Como el centro del intervalo es el mismo \bar{y}_{\text{obs}} —Proposición 15.9— y su dispersión real es \sigma/\sqrt{m}, estrechar el intervalo por un factor menor que uno sin mover el centro solo puede reducir la probabilidad de cubrir \mu.

Con 40 % de huecos el factor es 0{,}6: el intervalo del 95 % se reporta con seis décimas de su ancho correcto. No es una pérdida pequeña de cobertura; el visual la mide.

Los huecos de ese visual son MCAR: el caso benigno, en el que borrar las filas incompletas es correcto. Lo que se rompe no lo rompe el mecanismo, lo rompe el relleno. La tercera opción —rellenar con la media más un ruido de la misma desviación típica que lo observado— devuelve la dispersión y sin embargo tampoco alcanza: el intervalo sigue dividiendo entre n como si hubiera n datos independientes, y solo hay m. Ese residuo es lo que la imputación múltiple resuelve, imputando varias veces y sumando la variabilidad entre imputaciones a la de dentro de cada una; queda fuera de esta lección, pero el hueco que tapa es exactamente este.

La celda comprueba la identidad de la Proposición 15.9 hasta el último dígito y mide la cobertura.

La razón de varianzas sale 0{,}602007 y el factor (m-1)/(n-1) sale 0{,}602007, hasta el último dígito: la Proposición 15.9 es una identidad algebraica, no una aproximación asintótica. La cobertura pasa de 95{,}00\,\% a 76{,}09\,\%. Uno de cada cuatro intervalos falla, y el análisis no da ninguna señal de que algo vaya mal: los datos parecen completos porque alguien los completó.

4. Lo que los datos no pueden decir

Queda el caso MNAR, y la pregunta obvia: ¿qué estimador lo corrige? La respuesta es que la pregunta está mal planteada.

Proposición 15.11 (MNAR no es identificable). La distribución de los datos observados (R,\,RY) determina únicamente q=P(R=1) y la ley condicional f(y\mid R=1). La ley f(y\mid R=0) no está restringida por los datos: para cualquier densidad g existe una población compatible con exactamente los mismos datos observados, a saber f(y) = q\,f(y\mid R=1) + (1-q)\,g(y). En consecuencia, si Y toma valores en [a,b], todo lo que los datos determinan sobre E[Y] es la pertenencia al intervalo \Big[\;q\,E[Y\mid R=1] + (1-q)\,a,\;\;\; q\,E[Y\mid R=1] + (1-q)\,b\;\Big], de ancho (1-q)(b-a), y ningún punto de ese intervalo puede descartarse con los datos observados.

Demostración. Un dato observado es el par (R, RY): cuando R=0 el segundo componente vale 0 sin importar cuánto valía Y, así que la ley de los datos observados queda descrita por P(R=1)=q y por la ley de Y condicionada a R=1. Dadas esas dos piezas y cualquier densidad g con soporte en [a,b], la mezcla f = q f(\cdot\mid R=1) + (1-q)g es una densidad legítima, y la población que la tiene, con mecanismo P(R=1\mid Y=y) = q f(y\mid R=1)/f(y), reproduce exactamente los mismos datos observados. Por la ley de la esperanza total, E[Y] = q E[Y\mid R=1] + (1-q)E_g[Y], y E_g[Y] recorre todo [a,b] al recorrer g las densidades con ese soporte —los extremos se alcanzan con la masa puntual en a y en b—.

Tres consecuencias que conviene tener escritas.

  1. No hay método que arregle MNAR con los datos solos. Cualquier procedimiento que dé una respuesta única está metiendo un supuesto adicional sobre f(y\mid R=0); el trabajo honesto es decir cuál.
  2. La fracción que falta es el ancho del desconocimiento. El intervalo mide (1-q)(b-a): con Y acotada, bajar la no respuesta del 40 % al 10 % encoge las cotas cuatro veces. Reducir 1-q vale más que cualquier técnica aplicada después.
  3. Sin cota inferior ni superior para Y, no hay cotas. Si Y no está acotada, el intervalo de la Proposición 15.11 es toda la recta: la media de los ingresos, sin un tope conocido, no admite ninguna cota a partir de los datos. Por eso el visual siguiente pregunta por una proporción, que siempre está entre 0 y 1.

El deslizador de ese visual no toca ningún dato: lo único que mueve es el supuesto sobre las celdas grises, que nadie observó. Por eso el bloque verde se queda inmóvil mientras el marcador naranja recorre toda la franja. Esa inmovilidad es el contenido: si mover el supuesto de un extremo al otro no cambia ni un dato observado, entonces ningún estadístico calculado sobre los datos observados puede elegir entre los dos extremos. La franja es lo que los datos sí determinan; el punto exacto dentro de ella es lo que hay que suponer.

La celda construye dos poblaciones con datos observados idénticos, bit a bit, y medias muy distintas.

El mundo A tiene media 1573{,}3 y el mundo B, 2057{,}1: casi quinientas unidades de diferencia. Los dos producen el mismo conjunto de datos observados, y por tanto el mismo valor de cualquier estadístico que se calcule con ellos. La única cantidad que los datos sí acotan es la proporción, porque está confinada entre 0 y 1: las cotas salen [9{,}0\,\%,\;52{,}0\,\%] y el valor verdadero, 34{,}0\,\%, cae dentro. Un intervalo de 43 puntos es un resultado pobre, y es honesto: es lo que hay.

Note

Con una fracción de no respuesta del 43 %, las cotas de una proporción tienen 43 puntos de ancho. Suele ser más informativo publicar eso que publicar un número puntual que depende por completo de un supuesto que nadie puede comprobar.

Ejercicios

Ejercicio 1 — Post-estratificar con estratos cada vez más finos

La Proposición 15.8 reponderó con la propensión exacta, que en la práctica no se conoce. Una alternativa que solo usa X: partir la muestra en K estratos según xpost-estratificación—, promediar y dentro de cada estrato con los que sí respondieron, y recombinar con el peso que cada estrato tiene en la muestra completa. Comprobar que el sesgo baja al afinar los estratos, y explicar por qué con K=1 el estimador coincide con la media de casos completos.

Con un solo estrato el estimador es la media cruda y el sesgo es el de la tabla de la sección 2. Con 16 estratos queda en +1{,}62: la post-estratificación se acerca a la reponderación exacta a medida que dentro de cada estrato la propensión deja de variar. El límite no es gratis —estratos más finos tienen menos casos completos cada uno, y alguno puede quedarse vacío—, que es otra vez el intercambio entre sesgo y varianza.

Ejercicio 2 — Cuándo un faltante mata la pendiente y cuándo no

La lección se ha ocupado de faltantes en Y. Este ejercicio compara cuatro reglas de selección sobre el mismo modelo de la lección 13: que no falte nada, que la respuesta dependa de x, que dependa del error \varepsilon, y que dependa de y. Predecir antes de correr cuál de las tres últimas sesga \hat\beta_1, cuál sesga \hat\beta_0 y cuál solo cuesta precisión.

El resultado sorprende hasta que se mira la Proposición 15.7. Seleccionar según x no sesga ni \hat\beta_1 ni \hat\beta_0, y solo encarece: SCX cae a menos de la mitad y el error estándar de \hat\beta_1 sube de 7{,}03 a 10{,}61, que es la Proposición 14.2 cobrando su factura. Seleccionar según el error \varepsilon es MNAR y aun así deja \hat\beta_1 intacto —el sesgo se lo lleva entero \hat\beta_0, -118{,}5—, porque truncar los errores por igual en todas las columnas desplaza la recta sin inclinarla. Solo cuando la selección depende de y, que mezcla x y \varepsilon, la pendiente se sesga: -11{,}56, casi el 10 %. MNAR no arruina todo lo que se calcule: arruina lo que dependa de la parte que la selección toca.

Reto

En proyectos/notebooks/F1-retos.ipynb, sección Est 15:

  1. Escribir sesgo_por_mecanismo(mecanismo, n, reps) que devuelva el sesgo de la media de casos completos, el de la pendiente y el error de Monte Carlo de cada uno, para los tres mecanismos. Comprobar que el de MCAR es compatible con cero a dos errores de Monte Carlo y que el de MNAR no lo es.
  2. Implementar la reponderación de la Proposición 15.8 estimando la propensión en vez de conocerla: ajustar \hat{q}(x) con una regresión logística escrita a mano por descenso de gradiente, reponderar con 1/\hat{q}(x) y comparar contra usar la propensión verdadera. Medir qué pasa cuando el modelo de propensión está mal especificado —ajustar una recta cuando la verdad es cuadrática— y cuando algún \hat{q}(x) se acerca a cero.
  3. Reproducir la Proposición 15.11 al revés: partiendo de un conjunto observado fijo, construir explícitamente las dos poblaciones extremas que alcanzan las cotas y dibujar la franja de valores compatibles en función de la fracción que falta, de 0 % a 60 %.

Del libro

El sitio de Python for Data Analysis declara que su contenido no se puede copiar ni reproducir, así que aquí no hay cita textual: se cita número y título de sección, que es lo que el índice verificado permite, y no se le atribuyen al autor palabras que esta página no puede transcribir.

Preguntas para leer §7.1 Handling Missing Data con lápiz:

  1. El capítulo enumera las funciones de pandas para faltantes —dropna, fillna, isna, notna— y muestra dropna(how="all") y dropna(axis="columns"). ¿Cuál de las definiciones 15.2 a 15.4 tiene que ser cierta para que dropna() sin más argumentos deje un análisis insesgado? ¿Y qué habría que comprobar en los datos antes de escribirlo?
  2. La sección de Filling In Missing Data llama a fillna «el caballo de batalla» y muestra rellenar con una constante, con un valor distinto por columna y con ffill. Según la Proposición 15.9, ¿cuál de esas tres opciones deja la varianza muestral intacta y cuál la encoge? ¿Cuánto, en el caso de la constante?
  3. §7.1 observa que suele ser importante analizar los propios faltantes para detectar problemas de recolección o sesgos. Traducido a la Proposición 15.5: ¿qué gráfico o tabla concreta sobre R habría que mirar para estimar \text{Cov}(Y,R), y por qué ese cálculo es imposible exactamente cuando más falta hace?

Para el Cerebro

Nota nueva en 10-Conceptos/datos-faltantes.md, enlazada a [[covarianza]], [[intervalo-de-confianza]] y [[regresion-lineal]]. La Proposición 15.5 conviene rehacerla a mano: es de tres líneas y deja la clasificación MCAR/MAR/MNAR como consecuencia y no como lista que memorizar.

¿Qué es R_i en esta lección?::El indicador de respuesta: 1 si y_i se observa, 0 si falta (Definición 15.1)
¿Qué dice MCAR?::Que P(R=1|X,Y) = P(R=1): responder no depende de nada
¿Qué dice MAR?::Que P(R=1|X,Y) = P(R=1|X): depende solo de lo observado
¿Qué dice MNAR?::Que P(R=1|X,Y) sigue dependiendo de Y aun fijando X
¿Cuál es el sesgo de la media de casos completos?::Cov(Y,R)/P(R=1), exactamente (Proposición 15.5)
¿Qué cuesta MCAR?::Precisión y nada más: la muestra efectiva pasa de n a nπ, y el error estándar sube 1/√π
¿Qué sobrevive bajo MAR?::La ley de Y dado X, y con ella los coeficientes de regresión; la media marginal no
¿Cómo se corrige la media bajo MAR?::Reponderando por 1/π(X), con positividad π(x) > 0 (Proposición 15.8)
¿Qué le hace a la varianza rellenar con la media?::La multiplica por (m−1)/(n−1): la encoge (Proposición 15.9)
¿Y al intervalo de confianza?::Lo estrecha por el factor ≈ m/n y le hunde la cobertura, incluso con datos MCAR
¿Por qué no hay estimador que corrija MNAR?::Porque f(y|R=0) no está identificada: dos poblaciones distintas dan datos observados idénticos (Proposición 15.11)
¿Qué sí determinan los datos bajo MNAR?::Cotas de ancho (1−π)(b−a) si Y está acotada; nada si no lo está
¿Falta según x sesga la pendiente?::No: solo baja SCX y encarece el error estándar (Proposición 15.7)
¿Falta según y sesga la pendiente?::Sí, porque la selección mezcla x con el error

Fuentes

Lo que esta página demuestra sola. Las Proposiciones 15.5, 15.6, 15.7, 15.8, 15.9, 15.10 y 15.11 se demuestran aquí, a partir de la definición de covarianza (lección 5), la regla de Bayes, la ley de la esperanza total y la construcción de \hat\beta_1 de la Proposición 14.2. Se comprueban además numéricamente: los tres mecanismos simulados sobre la misma población, la reponderación contra la media cruda con su error de Monte Carlo, la identidad s^2_{\tilde{y}} = \frac{m-1}{n-1}s^2_{\text{obs}} hasta 10^{-9}, la caída de cobertura de 95{,}00\,\% a 76{,}09\,\%, y dos poblaciones con datos observados idénticos y medias separadas por casi 500 unidades. Los tres visuales se contrastaron contra numpy antes de publicarse: 3 mecanismos × 13 fracciones de faltantes para el primero, 3 métodos × 13 fracciones para el segundo, y 3 fracciones × 51 supuestos para el tercero.

Lo que se usa de otras lecciones sin repetir. La definición y las propiedades de la covarianza son la lección 5. Que \hat\beta_1 se escribe como \beta_1+\sum_ic_i\varepsilon_i condicionando en los x_i, y que su varianza es \sigma^2/\text{SCX}, es la Proposición 14.2. La lectura de la cobertura de un intervalo es la de la Proposición 9.7. El intercambio entre sesgo y varianza es la lección 7.

Lo que se enuncia sin demostrar. Nada esencial. La imputación múltiple se menciona como la reparación del residuo que deja la imputación con ruido, pero no se define ni se demuestra: queda para una lección propia.

Lo que viene de los libros.

  • Python for Data Analysis, 3.ª ed. (McKinney), §7.1 Handling Missing Data — citada por número y título. El sitio del libro declara que su contenido no se puede copiar ni reproducir, de modo que no se transcribe ninguna frase y las preguntas de lectura se refieren a lo que esa sección hace (dropna, fillna, isna, notna, el relleno por columna y ffill), verificado abriendo la sección el 12-09-2026.

Lo que es mío, no del libro. La numeración de definiciones y proposiciones. La demostración del sesgo como covarianza reescalada (Proposición 15.5) y su uso como eje para ordenar los tres mecanismos; la deducción de que bajo MAR sobrevive la regresión por el argumento condicional de la Proposición 14.2; la identidad exacta de la Proposición 15.9 y su traducción a cobertura; y la construcción explícita de dos poblaciones indistinguibles de la Proposición 15.11. La taxonomía MCAR/MAR/MNAR y las cotas de no respuesta para una cantidad acotada son estándar en la literatura de datos faltantes; ninguno de los libros con índice verificado en verificar/indices.json las trata, así que esta página las construye desde cero y no cita fuente para ellas —por la regla 3 de CLAUDE.md, antes que citar de memoria, no se cita—.

Índice de McKinney 3E ampliado y verificado el 12-09-2026 contra el índice publicado del capítulo 7.