Glosario

Términos y símbolos, con la lección donde se introducen

Los mismos textos que aparecen al pasar el cursor sobre un término subrayado o sobre un símbolo de una fórmula. Son definiciones de trabajo: para la definición formal, la lección.

Símbolos

erre
El conjunto de los números reales. ℝⁿ es el espacio de vectores con n coordenadas reales. matematica 01
transpuesta
Intercambia filas por columnas. Para dos vectores columna, uᵀv es el producto interno: un solo número. matematica 04
B be
El número de remuestreos bootstrap. Controla solo el error de Monte Carlo; no sustituye a n, que es el que controla el error estadístico. estadistica 11
F efe
La función acumulada de una distribución. F̂ₙ (con sombrero) es la empírica, calculada a partir de los datos; F sin sombrero, la verdadera y desconocida. estadistica 11
L ele
La función de verosimilitud L(θ): la probabilidad o densidad de los datos observados si el parámetro valiera θ. estadistica 08
ele minúscula
La log-verosimilitud, ℓ(θ) = log L(θ). Es la que se maximiza en la práctica. estadistica 08
n ene
El tamaño de la muestra: cuántos datos se observaron. No confundir con N, que a veces denota el tamaño de la población. estadistica 01
p pe
Según el contexto: una probabilidad, la función de masa p(x), o el número de columnas de una matriz de diseño. La lección lo declara en su tabla de notación. estadistica 02
Q cu
La suma de cuadrados centrada, Q = Σᵢ (xᵢ − x̄)². Dividida entre n da la varianza de máxima verosimilitud; entre n−1, la insesgada. estadistica 08
T te
Una variable con distribución t de Student. T con subíndice ν indica sus grados de libertad. estadistica 09
z zeta
El cuantil de la normal estándar. z con subíndice α/2 deja α/2 de probabilidad en la cola derecha: 1.96 al 95 %, 2.576 al 99 %. estadistica 09
α alfa
En la distribución de Pareto, el exponente de la cola: cuanto menor es α, más pesada la cola. En otros contextos, un nivel de significancia o una tasa de aprendizaje. estadistica 03
β beta
Los coeficientes de un modelo de regresión; β̂ (con sombrero) son los estimados a partir de los datos. En pruebas de hipótesis, la probabilidad de error de tipo II: la potencia es 1 − β. matematica 06
γ gamma
Con subíndice, un momento estandarizado: γ₁ es la asimetría y γ₂ la curtosis en exceso. estadistica 04
δ delta
Una cantidad pequeña: en optimización, un desplazamiento; en análisis, la tolerancia de una definición de límite. En pruebas de hipótesis, el tamaño real del efecto, μ − μ₀. Δ (mayúscula) suele marcar una diferencia entre dos valores. matematica 07
ε épsilon
Una cantidad muy pequeña. En estadística, el término de error de un modelo; en cómputo numérico, la precisión de la máquina. matematica 06
θ theta
Tiene dos usos. En álgebra lineal, el ángulo entre dos vectores, cuyo coseno es la correlación. En estimación, el parámetro verdadero y desconocido que se quiere estimar; el estimador que lo aproxima lleva sombrero, θ̂. matematica 04
κ kappa
El número de condición de una matriz: cuánto amplifica los errores de redondeo. Cuanto mayor, más precisión se pierde al resolver el sistema. matematica 06
λ lambda
La tasa de una distribución exponencial o de Poisson: cuántos eventos por unidad de tiempo. La media de la exponencial es 1/λ. estadistica 03
μ mu
La media de una distribución, es decir E[X]. Se usa cuando se la trata como una constante conocida. Su versión muestral es x̄. estadistica 04
ν nu
Grados de libertad de una distribución t o chi cuadrado. Al estimar la media con n datos valen n − 1, porque x̄ ya consumió uno. estadistica 09
π pi
La constante 3.14159…, que aparece en la densidad de la normal. Con subíndices también se usa para probabilidades. estadistica 03
ρ rho
La correlación poblacional entre dos variables. Su versión muestral se escribe r. estadistica 05
σ sigma
La desviación estándar: la raíz de la varianza, en las mismas unidades que la variable. σ² es la varianza. estadistica 04
Σ sigma mayúscula
Símbolo de suma. Σᵢ₌₁ⁿ xᵢ significa «suma x₁ + x₂ + … + xₙ». El subíndice dice desde dónde empieza y el superíndice hasta dónde llega. estadistica 01
τ tau
La precisión, es decir 1/σ². En la actualización normal-normal la precisión posterior es τ₀ + nτ: la información de las dos fuentes se suma. estadistica 19
Φ Phi
La función de distribución acumulada de la normal estándar: Φ(z) es la probabilidad de que una normal de media 0 y desviación 1 sea menor o igual que z. Φ⁻¹ es su inversa, la función probit. estadistica 03
χ ji
La distribución ji cuadrado. χ²ᵥ es la suma de v normales estándar al cuadrado; su media es v y su varianza 2v. estadistica 12
derivada parcial
Derivada respecto a una variable manteniendo las otras fijas. matematica 06
nabla
El gradiente: el vector de derivadas parciales. Apunta en la dirección de máximo crecimiento de la función. matematica 06
pertenece a
x ∈ A se lee «x pertenece a A» o «x está en A». matematica 01
fin de demostración
Marca el final de una demostración. Equivale a «queda demostrado» (en latín, QED). estadistica 04
productorio
Símbolo de producto. ∏ᵢ₌₁ⁿ aᵢ significa «multiplica a₁ · a₂ · … · aₙ», igual que Σ los suma. estadistica 08
suma
Ver Σ. estadistica 01
proporcional a
«Proporcional a»: igual salvo un factor que no depende de la variable de la que se habla. En Bayes permite descartar la evidencia y quedarse con el núcleo. estadistica 19
infinito
No es un número: indica que algo crece sin cota, o que un intervalo no tiene extremo. estadistica 02
integral
Suma continua. ∫f(x)dx es el área bajo la curva f; para una densidad, esa área es una probabilidad. estadistica 02
aproximadamente igual
Igual hasta un error pequeño. En cómputo suele significar «igual hasta el error de redondeo». python 06
perpendicular
Dos vectores son perpendiculares (u ortogonales) si su producto interno es cero. matematica 04
equis barra
La media muestral: el promedio de los n datos observados. Es una estimación de μ, que no se conoce. estadistica 04
equis sombrero
El sombrero marca un valor estimado o ajustado, no observado. ŷ son las predicciones del modelo; β̂ los coeficientes estimados. matematica 06
equis tilde
La tilde marca una variable centrada: se le restó su media, así que su media es cero. estadistica 05
E[X] esperanza de equis
El valor esperado de X: su promedio ponderado por la probabilidad. Es un número, no una variable. estadistica 04

Términos

acumulada empírica F̂ₙ(x)
La proporción de datos observados menores o iguales a x. Es una escalera con un escalón de 1/n en cada dato, y no depende de elegir intervalos. estadistica 02
análisis de casos completos
Analizar solo las filas sin huecos, descartando el resto. Es insesgado si el hecho de responder no covaría con lo que se mide, y solo en ese caso. estadistica 15
ángulo entre vectores θ
El único θ en [0, π] con cos θ = ⟨u,v⟩ / (‖u‖‖v‖). Está bien definido gracias a Cauchy-Schwarz, que garantiza que ese cociente no se sale de [−1,1]. matematica 04
asimetría γ₁
El tercer momento estandarizado, E[((X − μ)/σ)³]. Vale 0 en una distribución simétrica; positivo si la cola larga está a la derecha. estadistica 04
autocorrelación ρₖ
La correlación de una serie consigo misma a un retardo dado. En una cadena MCMC es lo que hace que n iteraciones valgan menos que n muestras independientes. estadistica 22
balance detallado π(x)P(x,y)
Que en equilibrio pase tanta masa de x a y como de y a x: π(x)P(x,y) = π(y)P(y,x). Es condición suficiente de estacionariedad, y se comprueba mirando pares de estados. estadistica 22
base
Una familia linealmente independiente cuyo span es todo el espacio. Su tamaño es la dimensión, y en ella las coordenadas de cada vector son únicas. matematica 01
base ortonormal
Una base de vectores perpendiculares entre sí y de norma 1, es decir QᵀQ = I. En ella la proyección se calcula con productos internos, sin resolver ningún sistema. matematica 07
bootstrap
Sortear n datos con reemplazo de la muestra, recalcular el estadístico y repetir B veces. Estima la anchura de la distribución muestral, no corrige su centro. estadistica 11
cadena de Markov P(x,y)
Una sucesión aleatoria en la que el siguiente estado depende del pasado solo a través del actual. Lo que la hace útil aquí es que se puede diseñar para que su distribución de equilibrio sea el posterior. estadistica 22
calibración
Que un pronóstico probabilístico diga la verdad sobre el nivel: entre los casos en que anunció p, la frecuencia real fue p. Se comprueba por grupos de casos, nunca sobre uno solo. estadistica 16
cancelación catastrófica
Pérdida de precisión en punto flotante al restar dos números casi iguales: los dígitos que coinciden se anulan y queda solo el ruido de redondeo. estadistica 04
cauchy
Distribución simétrica de colas tan pesadas que no tiene media ni varianza finitas. La media de n observaciones suyas es otra Cauchy con la misma dispersión. estadistica 06
cdf F(x)
La función de distribución acumulada F(x) = P(X ≤ x). Sirve igual para variables discretas y continuas, y por eso es la herramienta de diagnóstico del módulo. estadistica 02
centrar
Restar la media a cada valor. La variable centrada tiene media cero, y es la operación que convierte la estadística en geometría. estadistica 05
cobertura
La probabilidad real de que un intervalo contenga el parámetro. La nominal es la que el método anuncia; no siempre coinciden. estadistica 09
coeficiente de determinación
R² = SCR/SCT, la fracción de la varianza que explica la recta. En regresión simple vale r². Mide cuánto ajusta, no si el modelo es el correcto. estadistica 13
colinealidad
Que una columna de la matriz de diseño sea combinación lineal de otras. Baja el rango, hace infinitas las soluciones y vuelve inidentificables los coeficientes. matematica 03
combinación lineal
Una suma de vectores multiplicados por escalares: a₁v₁ + … + aₙvₙ. Es la única expresión que permiten formar las dos operaciones de un espacio vectorial, y de ella salen el span, el rango y el producto matriz-vector. matematica 01
condicional completa π(θⱼ|θ₋ⱼ,x)
La distribución de un bloque de parámetros dados todos los demás y los datos. Se obtiene tachando del posterior conjunto todo lo que no contiene ese bloque. estadistica 23
condiciones KKT
Las cuatro condiciones de Karush-Kuhn-Tucker: estacionariedad, factibilidad, multiplicadores no negativos y holgura complementaria. En un problema convexo certifican el óptimo global. matematica 18
conjunto convexo
Un conjunto donde el segmento que une dos puntos cualesquiera se queda dentro. matematica 15
consistencia
La propiedad de un estimador cuyo error se hace arbitrariamente pequeño al crecer la muestra. Es distinta de la insesgadez: hay estimadores insesgados que no son consistentes. estadistica 07
converge en distribución →ᵈ
Que la función acumulada de una sucesión de variables tiende, en cada punto, a la acumulada de una variable límite. estadistica 06
convergencia cuadrática
Una sucesión donde el error nuevo es proporcional al cuadrado del anterior: ‖e_{k+1}‖ ≤ C‖e_k‖². El número de dígitos correctos se duplica en cada paso. matematica 17
corrección de Bonferroni
Exigir p ≤ α/m en cada una de las m pruebas. Controla la tasa de error por familia sin suponer independencia, por la desigualdad de Boole, y es conservadora si las pruebas están correlacionadas. estadistica 17
correlación ρ, r
La covarianza dividida entre el producto de las desviaciones estándar. Es adimensional y vive en [−1, 1]. Mide solo asociación lineal. estadistica 05
covarianza Cov(X,Y)
La esperanza del producto de las desviaciones de dos variables: Cov(X,Y) = E[(X − μₓ)(Y − μᵧ)]. Mide si tienden a desviarse en la misma dirección. estadistica 05
curtosis γ₂
El cuarto momento estandarizado, E[((X − μ)/σ)⁴]. La curtosis en exceso le resta 3, que es el valor de la normal, para que la normal quede en 0. estadistica 04
curva de ganancia G(u)
La fracción de todos los positivos que cae dentro del u por ciento de casos con mayor pronóstico. Depende solo del orden, no del nivel anunciado. estadistica 16
definida positiva A ≻ 0
Una matriz simétrica con xᵀAx > 0 para todo x ≠ 0, lo que equivale a que todos sus eigenvalores sean positivos. Sus curvas de nivel son elipses. matematica 12
derivada f'(a)
La tasa de cambio instantánea de una función en un punto: el límite del cociente de incrementos [f(a+h)−f(a)]/h cuando h tiende a cero. matematica 13
derivada direccional D_vf(a)
La tasa de cambio de una función en un punto, medida en una dirección unitaria concreta. La derivada parcial es el caso particular en la dirección de un vector de la base canónica. matematica 13
derivada parcial ∂f/∂xᵢ
La derivada de una función de varias variables respecto a una sola de ellas, con las demás fijas. matematica 13
descenso de gradiente η
El método que avanza en contra del gradiente: x_{k+1} = x_k − η∇f(x_k). Con paso suficientemente corto la función baja en cada iteración. matematica 16
descomposición en valores singulares SVD
A = U Σ Vᵀ con U y V ortogonales y Σ diagonal no negativa. La tiene toda matriz, sea o no cuadrada: rota, estira cada eje y vuelve a rotar. matematica 11
desigualdad de Cauchy-Schwarz
|⟨u,v⟩| ≤ ‖u‖‖v‖, con igualdad solo si uno de los vectores es múltiplo del otro. Es lo que hace existir al ángulo y lo que acota la correlación entre −1 y 1. matematica 04
desigualdad triangular
‖u+v‖ ≤ ‖u‖ + ‖v‖: ir en línea recta nunca es más largo que dar un rodeo. La igualdad exige que uno sea múltiplo no negativo del otro. matematica 04
desviación estándar σ
La raíz cuadrada de la varianza. Mide dispersión en las mismas unidades que la variable. estadistica 04
determinante det(A)
El factor por el que una matriz multiplica todo volumen. En 2×2 vale ad − bc, y su valor absoluto es el área del paralelogramo de sus columnas. Vale cero exactamente cuando la matriz no tiene inversa. matematica 08
diagonalizable
Una matriz es diagonalizable si se escribe A = P D P⁻¹ con D diagonal, lo que ocurre exactamente cuando tiene n eigenvectores independientes. En su propia base solo estira ejes. matematica 10
diferenciable
Una función es diferenciable en un punto si ahí admite una aproximación lineal cuyo error se hace despreciable frente a la distancia al punto. matematica 13
distribución
La descripción completa de qué valores puede tomar una variable aleatoria y con qué probabilidad. La PMF, la PDF y la CDF son tres formas de escribirla. estadistica 01
distribución Beta Beta(a,b)
La distribución sobre (0,1) con densidad proporcional a θ^(a−1)(1−θ)^(b−1) y media a/(a+b). Es el prior conjugado de la verosimilitud binomial. estadistica 19
distribución Beta-binomial BetaBin(ñ,a,b)
La predictiva de ñ ensayos bajo un posterior Beta(a,b). Tiene la misma media que la binomial de enchufe y varianza mayor en razón (a+b+ñ)/(a+b+1). estadistica 20
distribución binomial negativa BinNeg(a,p)
La predictiva de un conteo bajo un posterior Gamma. Aparece siempre que se promedian Poissons con media incierta, y por eso los conteos reales suelen estar sobredispersos. estadistica 20
distribución empírica F̂ₙ
La distribución que pone masa 1/n en cada dato observado. Es el modelo más simple posible de la población: la propia muestra. estadistica 11
distribución estacionaria πP = π
La distribución que la cadena deja invariante: si se arranca en ella, se sigue en ella. El objetivo de MCMC es construir una cadena cuya estacionaria sea el posterior. estadistica 22
distribución Gamma Gamma(a,b)
La distribución sobre (0,∞) con densidad proporcional a λ^(a−1)e^(−bλ), forma a y tasa b, de media a/b. Es el prior conjugado de la verosimilitud de Poisson. estadistica 19
distribución muestral
Cómo se reparten los valores de un estadístico al repetir el muestreo muchas veces sobre la misma población. estadistica 01
distribución predictiva p(x̃|x)
La distribución del próximo dato, obtenida integrando la verosimilitud contra el posterior. Vive en el espacio de los datos, no en el del parámetro. estadistica 20
distribución t de Student T_ν
Distribución simétrica de colas más pesadas que la normal, con ν grados de libertad. Aparece al estandarizar la media muestral usando s en vez de σ, y converge a la normal cuando ν crece. estadistica 09
ecuaciones normales
AᵀA x̂ = Aᵀb, el sistema que resuelve la proyección sobre el espacio columna de A. Sale de exigir que el residuo sea ortogonal a todas las columnas. matematica 05
eigenvalor λ
El factor λ por el que se estira un eigenvector. Se obtiene resolviendo det(A − λI) = 0. matematica 09
eigenvector
Un vector no nulo al que la matriz no gira: Av = λv. Marca una dirección que la transformación deja quieta, solo estirada. matematica 09
error cuadrático medio ECM
El promedio del cuadrado de la distancia entre el estimador y el valor verdadero: E[(θ̂ − θ)²]. Se descompone en sesgo al cuadrado más varianza. estadistica 07
error de Monte Carlo EMC
σ/√n_ef: el error estándar de un resumen calculado sobre una cadena. Decide cuántas cifras de un resultado son defendibles. estadistica 24
error de tipo I
Rechazar la hipótesis nula siendo cierta. Su probabilidad es α, y la fija el umbral elegido: no depende de n ni del tamaño del efecto. estadistica 10
error de tipo II
No rechazar la hipótesis nula siendo falsa. Su probabilidad es β, y sí depende del tamaño del efecto y de n. estadistica 10
error estándar EE
La desviación estándar de un estadístico entre muestras. Para la media vale σ/√n: baja con la raíz de n, no con n. estadistica 01
espacio columna col(A)
El conjunto de todos los Ax posibles, que es el span de las columnas de A. Es todo lo que la matriz puede producir: su alcance. matematica 03
espacio vectorial
Un conjunto donde se puede sumar y escalar respetando ocho condiciones. Los vectores de Rⁿ, las funciones y los polinomios lo son, y todo lo que se demuestre para uno vale para los demás. matematica 01
esperanza E[X], μ
El promedio de una variable aleatoria ponderado por su probabilidad: E[X] = Σ x·p(x) en el caso discreto, ∫ x·f(x) dx en el continuo. También se llama valor esperado o media de la distribución. estadistica 04
estadístico x̄, s
Un número calculado a partir de la muestra, como x̄ o s. Cambia con cada muestra, así que es una variable aleatoria. estadistica 01
estadístico de prueba
Una función de la muestra elegida de modo que sus valores grandes sean evidencia contra la hipótesis nula. estadistica 10
estandarizar z
Restar la media y dividir entre la desviación estándar: z = (x − μ)/σ. El resultado no tiene unidades y tiene media 0 y desviación 1. estadistica 04
estimador
Una fórmula que se aplica a la muestra para aproximar una cantidad de la población. x̄ es un estimador de μ; s² es un estimador de σ². estadistica 04
estimador de enchufe p(·|θ̂)
Estimar el parámetro y después tratarlo como si fuera el valor verdadero. Ignora el término Var(E[x̃|θ]) de la varianza total, y por eso sus intervalos cubren menos de lo que prometen. estadistica 20
estrictamente convexa
Una función convexa cuya desigualdad es estricta fuera de los extremos. Garantiza que el minimizador, si existe, es único. matematica 15
evidencia m(x)
La verosimilitud marginal m(x) = ∫p(x|θ)π(θ)dθ, el denominador del teorema de Bayes. No depende del parámetro, así que con priors conjugados no hace falta calcularla. estadistica 19
exponencial Exp(λ)
Distribución de los tiempos de espera de un proceso sin memoria. Su complemento acumulado es e^(−λx), que es una recta en escala logarítmica vertical. estadistica 03
factor de Bayes
El cociente de verosimilitudes P(D|H)/P(D|¬H): cuánta evidencia trae un dato, con independencia del prior. Multiplica la razón previa para dar la posterior. estadistica 18
factorización de Cholesky
A = LLᵀ con L triangular inferior de diagonal positiva. Existe exactamente cuando A es definida positiva, así que intentarla es la forma barata de comprobarlo. matematica 12
factorización QR
Escribir A = QR con Q de columnas ortonormales y R triangular superior. Resuelve mínimos cuadrados sin formar AᵀA, trabajando con el condicionamiento de A y no con su cuadrado. matematica 07
falta de memoria
Propiedad de una variable de espera: haber esperado ya cierto tiempo no cambia la distribución de lo que queda. Caracteriza a la exponencial y a ninguna otra distribución continua. estadistica 03
forma cuadrática
La función q(x) = xᵀAx. En la base propia es una suma de cuadrados con pesos los eigenvalores, y de ahí sale todo: su signo, sus extremos y sus curvas de nivel. matematica 12
función convexa
Una función cuya gráfica queda por debajo de todas sus cuerdas: f(tx+(1−t)y) ≤ t f(x) + (1−t) f(y). Equivale a tener la hessiana semidefinida positiva. matematica 15
función de densidad f(x)
Para una variable continua, la función f(x) cuya integral sobre un intervalo da la probabilidad de caer en ese intervalo. El valor f(x) en un punto no es una probabilidad. estadistica 02
función de masa p(x)
Para una variable discreta, la función p(x) = P(X = x) que asigna a cada valor posible su probabilidad. estadistica 02
Gibbs sampling
Recorrer los bloques de parámetros sorteando cada uno de su condicional completa. Es Metropolis-Hastings con aceptación uno: no hay nada que rechazar ni que ajustar. estadistica 23
gradiente ∇f(a)
El vector de las derivadas parciales de una función. Para una función diferenciable, apunta en la dirección de máximo crecimiento y su norma es la tasa de ese crecimiento. matematica 13
gradiente Lipschitz L
Un gradiente que no puede cambiar más rápido que L veces la distancia: ‖∇f(y)−∇f(x)‖ ≤ L‖y−x‖. Para una cuadrática, la menor L válida es el mayor eigenvalor. matematica 16
grados de libertad
El número de valores que pueden variar libremente después de imponer las restricciones. Al calcular s² se impone que las desviaciones sumen cero, así que de n desviaciones solo n − 1 son libres. estadistica 04
Gram-Schmidt
El proceso que convierte una familia independiente en una ortonormal: a cada vector se le quitan sus sombras sobre los anteriores y se normaliza lo que queda. matematica 07
hessiana ∇²f
La matriz de todas las segundas derivadas parciales de una función. Es simétrica cuando esas parciales son continuas, y sus eigenvalores clasifican los puntos críticos. matematica 14
hipótesis nula H₀
Un modelo completo de cómo se generaron los datos, lo bastante concreto para poder calcular probabilidades bajo él. Es el modelo bajo el que se calcula el valor p. estadistica 10
holgura complementaria
La condición λᵢgᵢ(x*) = 0: para cada restricción de desigualdad, o está activa, o su multiplicador es cero. Una restricción que no aprieta no influye. matematica 18
i.i.d.
Independientes e idénticamente distribuidas. Son dos condiciones distintas: que ninguna informe sobre las otras, y que todas salgan de la misma distribución. estadistica 06
identificabilidad
Que dos poblaciones distintas no puedan producir la misma distribución de datos observados. Si un parámetro no está identificado, ningún método ni ninguna cantidad de datos lo determina: hace falta un supuesto. estadistica 15
imputación
Rellenar cada hueco con un valor estimado para poder analizar la tabla completa. Conserva la media si se rellena con ella, pero encoge la varianza y estrecha los intervalos. estadistica 15
imputación múltiple
Imputar varias veces con ruido, analizar cada versión y combinar los resultados sumando la variabilidad entre imputaciones a la de dentro de cada una. Es la forma de imputar sin mentir sobre la incertidumbre. estadistica 15
independencia
Dos variables son independientes si la distribución conjunta es el producto de las marginales: conocer una no cambia la distribución de la otra. Implica covarianza cero; lo contrario no es cierto. estadistica 05
independencia lineal
Que la única combinación lineal de unos vectores que da el cero sea la de todos los coeficientes nulos. Si no lo son, alguno sobra: se escribe con los demás. matematica 01
insesgado
Un estimador es insesgado si su esperanza coincide con la cantidad que estima: en promedio, sobre muchas muestras, acierta. Sesgo es la diferencia entre esa esperanza y el valor verdadero. estadistica 04
intervalo de confianza
Un intervalo cuyos extremos se calculan de la muestra, construido para contener al parámetro con probabilidad 1 − α. Lo aleatorio son los extremos, no el parámetro. estadistica 09
inversa-gamma IG(α,β)
La distribución de 1/G cuando G es Gamma. Es la condicional completa de una varianza con prior 1/σ², y por eso aparece en todo modelo normal con varianza desconocida. estadistica 23
lagrangiano
La función L(x,λ) = f(x) − λg(x). Sus puntos críticos reproducen a la vez la condición de Lagrange y la restricción, convirtiendo un problema con restricciones en uno sin ellas. matematica 18
lema de descenso
La cota f(y) ≤ f(x) + ∇f(x)·(y−x) + (L/2)‖y−x‖². Convierte «la función baja» en una cantidad medible por iteración. matematica 16
leverage hᵢᵢ
El elemento hᵢᵢ de la diagonal de la matriz sombrero: cuánto influye una observación sobre su propia predicción. Depende de dónde están los predictores, no del valor observado. matematica 06
ley de probabilidad total
P(D) = Σ P(D|Hᵢ)P(Hᵢ) sobre una lista exhaustiva y excluyente de hipótesis. Es lo que permite calcular el denominador de Bayes sumando una columna. estadistica 18
lift L(u)
La ganancia dividida entre la fracción elegida, G(u)/u: cuántas veces más positivos que eligiendo al azar. Su techo es min(1/u, 1/tasa base). estadistica 16
log-verosimilitud ℓ(θ)
El logaritmo de la verosimilitud. Tiene el máximo en el mismo sitio y convierte el producto en suma, lo que evita que se vuelva cero por underflow. estadistica 08
lognormal
Distribución de una variable cuyo logaritmo es normal. Aparece cuando una cantidad se forma multiplicando muchos factores. estadistica 03
MAR
Missing at random: la probabilidad de faltar depende solo de variables observadas. La media marginal queda sesgada, pero la ley de Y dado X —y con ella los coeficientes de regresión— se conserva. estadistica 15
matriz de covarianza Σ
La matriz cuyo elemento (i,j) es Cov(xᵢ, xⱼ). Es simétrica siempre, así que sus eigenvectores son perpendiculares y sirven de ejes. estadistica 12
matriz de proyección P
La matriz P tal que Pb es la proyección de b. Es simétrica e idempotente (P² = P), sus eigenvalores son ceros y unos, y su traza es la dimensión del subespacio. matematica 05
matriz simétrica
Una matriz igual a su traspuesta. Sus eigenvalores son reales y sus eigenvectores perpendiculares, que es lo que la hace manejable. matematica 09
matriz sombrero H
H = A(AᵀA)⁻¹Aᵀ, la que convierte y en ŷ. Es la matriz de proyección sobre el espacio columna; su traza son los grados de libertad del modelo y su diagonal, el leverage de cada observación. matematica 06
máxima verosimilitud
Método para construir estimadores: se elige el valor del parámetro bajo el cual los datos observados serían lo más probables posible. estadistica 08
MCAR
Missing completely at random: la probabilidad de que un dato falte es la misma para todos, sin depender de nada observado ni no observado. Cuesta precisión pero no sesga. estadistica 15
mecanismo de faltantes R
La regla —normalmente desconocida— que decide qué datos se observan y cuáles no. Se describe con la probabilidad de responder condicionada a los datos, y de ella depende si el análisis queda sesgado. estadistica 15
media muestral
El promedio de los n datos observados: x̄ = (1/n) Σ xᵢ. Es una estimación de la esperanza μ, que en general no se conoce. estadistica 04
mediana
El valor que deja la mitad de la probabilidad (o de los datos) a cada lado. A diferencia de la media, no se mueve por los valores extremos. estadistica 02
método de Holm
Recorrer los valores p ordenados rechazando mientras p₍ᵢ₎ ≤ α/(m−i+1). Da la misma garantía que Bonferroni y rechaza siempre al menos tanto, así que lo domina. estadistica 17
método de Newton
El método que en cada paso minimiza el modelo cuadrático de Taylor: x_{k+1} = x_k − H⁻¹∇f. En una cuadrática acierta de un solo salto. matematica 17
Metropolis-Hastings α(x,y)
El algoritmo que propone un salto y lo acepta con probabilidad min(1, π̃(y)q(x|y)/π̃(x)q(y|x)). Solo usa cocientes del objetivo, así que no necesita su constante de normalización. estadistica 22
mezcla de distribuciones Σ wⱼ pⱼ
Una distribución formada promediando otras con pesos que suman uno. Toda predictiva es una mezcla de las distribuciones de muestreo, pesadas por el posterior. estadistica 20
mínimo global
Un punto donde la función vale menos o igual que en todo el dominio, no solo en un entorno. En una función convexa todo mínimo local lo es. matematica 15
mínimos cuadrados
Encontrar los coeficientes que minimizan la suma de cuadrados de los residuos, ‖b − Ax‖². Su solución es la proyección de b sobre el espacio columna de A. matematica 06
MNAR
Missing not at random: la probabilidad de faltar depende del propio valor que falta, aun fijando lo observado. No se puede corregir con los datos solos: no está identificado. estadistica 15
momento β
El término β(x_k − x_{k−1}) que se suma al paso de descenso: arrastra la dirección anterior, cancela parte del zigzag y acumula avance en la dirección que se repite. matematica 16
muestra n
Un subconjunto de la población del que sí se observan los valores. Su tamaño se escribe n. estadistica 01
multiplicador de Lagrange λ
El escalar λ que mide cuánto hay que inclinar el gradiente del objetivo para alinearlo con el de la restricción. Cuantifica cuánto aprieta esa restricción. matematica 18
navaja de Occam bayesiana Σₓ m(x) = 1
Que un modelo más flexible sea penalizado sin añadir nada: su predictiva previa reparte una unidad de masa entre más conjuntos de datos posibles, así que le toca menos al que de verdad ocurrió. estadistica 21
Newton regularizado
La variante que usa H + μI en lugar de H, con μ el menor valor que la vuelve definida positiva, y recorta el paso hasta que la función baje. matematica 17
norma ‖u‖
La longitud de un vector, ‖u‖ = √⟨u,u⟩. Existe porque el producto interno es definido positivo: ⟨u,u⟩ nunca es negativo. matematica 04
normal N(μ, σ²)
Distribución acampanada y simétrica que aparece al sumar muchos efectos pequeños e independientes. Queda descrita por su media y su desviación. estadistica 03
normal multivariante
Un vector cuya densidad lleva la forma cuadrática (x−μ)ᵀΣ⁻¹(x−μ) en el exponente. Sus curvas de nivel son elipses con ejes en los eigenvectores de Σ. estadistica 12
núcleo ker(A)
El conjunto de vectores que la matriz manda al cero, {x : Ax = 0}. Es un subespacio, y su dimensión mide cuánta información aniquila la matriz. matematica 03
núcleo de una densidad
La densidad sin su constante de normalización: cualquier g con f = c·g y c independiente del parámetro. Reconocer el núcleo basta para identificar el posterior, porque dos densidades proporcionales son iguales. estadistica 19
número de condición κ
El cociente entre el mayor y el menor eigenvalor de una matriz definida positiva. Decide la velocidad del descenso de gradiente: la mejor tasa posible es (κ−1)/(κ+1). matematica 16
orientación
El sentido de giro que una transformación conserva o invierte. El signo del determinante lo dice: negativo significa que el plano se ha dado la vuelta, como en un espejo. matematica 08
ortogonalidad u ⊥ v
Dos vectores son ortogonales cuando su producto interno vale cero. Es una condición algebraica, y equivale a que el ángulo entre ellos sea recto. matematica 04
p-hacking
Reportar el mejor de varios análisis como si hubiera sido el único. El valor p que se publica ya no es uniforme bajo H₀ sino el mínimo de m, y por eso el umbral del 5 % deja de significar 5 %. estadistica 17
parámetro μ, σ
Un número que describe a la población, como μ o σ. Es fijo y desconocido; no se calcula, se estima. estadistica 01
pareto
Distribución de cola pesada cuyo complemento acumulado es una potencia de x. Es invariante de escala: su cola por encima de cualquier umbral es otra Pareto igual. estadistica 03
percentil F⁻¹(q)
El percentil q es el valor que deja una proporción q de la distribución por debajo. El rango percentil hace lo inverso: de un valor devuelve la proporción. estadistica 02
pérdida de ortogonalidad
Que las columnas que deberían ser perpendiculares dejen de serlo por el redondeo de punto flotante. Crece con el condicionamiento y distingue al Gram-Schmidt clásico del modificado. matematica 07
población
El conjunto completo de unidades sobre las que se quiere concluir algo. Casi nunca se observa entera. estadistica 01
polinomio característico
p(λ) = det(A − λI). Sus raíces son los eigenvalores. En 2×2 vale λ² − tr(A)λ + det(A). matematica 09
polinomio de Taylor
La aproximación polinómica de una función alrededor de un punto. El de orden dos añade a la recta tangente el término de curvatura ½hᵀ∇²f h. matematica 14
post-estratificación
Partir la muestra en estratos según una variable observada, promediar dentro de cada uno con los casos completos y recombinar con el peso real de cada estrato. Aproxima la reponderación por la propensión. estadistica 15
posterior P(H|D)
La distribución de creencia sobre las hipótesis después de ver los datos, proporcional al prior por la verosimilitud. estadistica 18
potencia
La probabilidad de detectar un efecto que sí existe: 1 − β. Sube con el tamaño del efecto y con n, que entra por la raíz. estadistica 10
potencia iterada
Multiplicar un vector por la matriz y renormalizar, una y otra vez. Converge a la dirección del eigenvector dominante, con error que cae como |λ₂/λ₁|^k. matematica 10
precisión τ
El inverso de la varianza, τ = 1/σ². Se usa porque al actualizar una normal las precisiones se suman, mientras que las varianzas no hacen nada simple. estadistica 19
prior P(H)
La distribución de creencia sobre las hipótesis antes de ver los datos. Sin él no se puede invertir el condicionamiento: es el precio que cobra el teorema de Bayes. estadistica 18
prior conjugado π(θ)
Un prior tal que el posterior cae en la misma familia. Es propiedad del par prior-verosimilitud: la Beta es conjugada frente a una binomial y no frente a una normal. estadistica 19
probabilidad condicional P(A|B)
P(A|B) = P(A∩B)/P(B): de todo el espacio en que B ocurre, qué fracción tiene también A. Exige P(B) > 0. estadistica 18
procedimiento de Benjamini-Hochberg
Rechazar las k hipótesis con menores valores p, donde k es el mayor índice con p₍ᵢ₎ ≤ αi/m. Controla la tasa de falsos descubrimientos, no la de error por familia. estadistica 17
proceso de poisson
Un flujo de eventos que ocurren a tasa constante e independientes entre sí. Los tiempos entre eventos consecutivos son exponenciales. estadistica 03
producto interno ⟨u,v⟩
La suma de los productos componente a componente de dos vectores, ⟨u,v⟩ = uᵀv. Es la operación que le da al espacio longitud, distancia y ángulo. matematica 04
propensión de respuesta q(x)
La probabilidad de que una unidad con covariables x se observe, q(x) = P(R = 1 | X = x). Reponderar por su inverso corrige el sesgo bajo MAR, siempre que sea positiva para todo x. estadistica 15
proyección ortogonal
La sombra de un vector sobre un subespacio: el único punto del subespacio cuyo residuo es perpendicular a él. Es también el punto más cercano, por Pitágoras. matematica 05
prueba de permutación
Construir la distribución bajo la hipótesis nula barajando las etiquetas de grupo. Es exacta: no es una aproximación que mejore con n. estadistica 11
pseudoconteo a+b
La lectura de los parámetros de un prior conjugado como datos ficticios ya observados: en una Beta(a,b), a éxitos y b fracasos, con a+b como tamaño de esa muestra imaginaria. estadistica 19
punto crítico
Un punto donde el gradiente se anula. Todo máximo o mínimo local de una función diferenciable lo es, pero no al revés. matematica 14
punto flotante
La representación de números reales en la computadora con un número fijo de dígitos significativos (unos 16 en float64). Toda operación redondea. python 06
punto silla
Un punto crítico que no es ni máximo ni mínimo: en unas direcciones la función sube y en otras baja. Aparece cuando la hessiana es indefinida. matematica 14
puntuación logarítmica Σ log p
La suma de los logaritmos de las probabilidades que un pronosticador asignó a lo que ocurrió. La verosimilitud marginal es exactamente eso, pronosticando cada dato con los anteriores. estadistica 21
quema
Los primeros estados de una cadena, que todavía recuerdan el punto de arranque y se descartan antes de resumir nada. estadistica 24
R de Gelman-Rubin
El diagnóstico R̂ = √(V̂/W), que compara la dispersión entre las medias de varias cadenas con la dispersión dentro de cada una. Con cadenas estacionarias vale aproximadamente √(1+(τ−1)/n), no uno. estadistica 24
rango
La dimensión del espacio columna: cuántas direcciones independientes hay entre las columnas. Es rango columna completo cuando iguala al número de columnas. matematica 03
recta de regresión
La recta que minimiza la suma de los cuadrados de los residuos. Su pendiente es Cov(x,y)/Var(x), y pasa siempre por (x̄, ȳ). estadistica 13
regla de la cadena
La derivada de una composición de funciones es el producto de las derivadas: (f∘g)'(a) = f'(g(a))·g'(a). matematica 13
regresión a la media
Que un valor extremo de x predice un valor menos extremo de y, porque la pendiente estandarizada es r < 1. Es aritmética, no un fenómeno causal. estadistica 13
regresión isotónica
Ajustar una función creciente por tramos a los datos fundiendo los bloques que violan la monotonía (PAVA). Recalibra un pronóstico sin cambiar el orden de los casos. estadistica 16
reparametrización
Cambiar las coordenadas en que se muestrea para quitar la correlación entre parámetros. Rotar a los ejes principales lleva el factor de ineficiencia de Gibbs de cien a uno. estadistica 23
residuo eᵢ
La diferencia entre un valor observado y el que predice la recta ajustada. No es el error del modelo: los errores son independientes, los residuos suman cero por construcción. estadistica 13
resolución de un pronóstico
Cuánto separa el pronóstico unos casos de otros, medido como la dispersión de las frecuencias reales de sus grupos respecto de la tasa base. Entra restando en el Brier: más resolución, mejor. estadistica 16
score de Brier BS
El error cuadrático medio de un pronóstico contra el resultado 0/1: E[(p̂ − Y)²]. Es una regla propia: se minimiza anunciando la probabilidad verdadera. estadistica 16
sesgo
La diferencia entre el promedio de un estimador sobre todas las muestras posibles y el valor verdadero: E[θ̂] − θ. Vale cero si el estimador acierta en promedio. estadistica 07
significancia estadística
Que el valor p cae por debajo de un umbral elegido de antemano, casi siempre 0.05. Es una convención, no un resultado matemático, y no dice nada sobre el tamaño del efecto. estadistica 10
sobredispersión Var > E
Que un conteo tenga más varianza que la que su modelo predice. Una mezcla de Poissons siempre está sobredispersa respecto de la Poisson con la misma media. estadistica 20
span
El conjunto de todas las combinaciones lineales de unos vectores dados. Es siempre un espacio vectorial, y en el plano es un punto, una recta o todo R². matematica 01
spearman
Correlación calculada sobre los rangos en vez de sobre los valores. Detecta cualquier relación monótona, aunque sea curva. estadistica 05
tabla bayesiana
Una fila por hipótesis y cuatro columnas: prior, verosimilitud, su producto y el posterior. La suma de la columna del producto es la evidencia. estadistica 18
tamaño de muestra efectivo n_ef
n/τ con τ = 1 + 2Σρₖ: cuántas muestras independientes darían la misma precisión que la cadena. Un τ de 150 significa una muestra útil por cada 150 iteraciones. estadistica 22
tasa base ȳ
La proporción de positivos en la población, E[Y]. Fija la incertidumbre del problema y el techo del lift, y no depende de ningún modelo. estadistica 16
tasa de aceptación α̂
La fracción de propuestas aceptadas. Cerca de uno indica un paso demasiado corto y cerca de cero uno demasiado largo; en una dimensión el óptimo ronda 0,44. estadistica 22
tasa de error por familia FWER
La probabilidad de cometer al menos un error de tipo I en toda una familia de pruebas. Es lo que controlan Bonferroni y Holm. estadistica 17
tasa de falsos descubrimientos FDR
La proporción esperada de hallazgos falsos entre los declarados. Es una promesa distinta —y más débil— que la tasa de error por familia, y la que controla Benjamini-Hochberg. estadistica 17
teorema central del límite
La suma estandarizada de n variables i.i.d. con media y varianza finitas converge a una normal estándar, sea cual sea la distribución de partida. estadistica 06
teorema de Bayes
P(H|D) = P(D|H)·P(H)/P(D). Invierte el condicionamiento —de «qué datos son probables dada la hipótesis» a «qué hipótesis es probable dados los datos»— a cambio de exigir un prior. estadistica 18
teorema del rango-nulidad
rango(A) + dim ker(A) = n, con n el número de columnas. Lo que gana el núcleo lo pierde el rango, en cantidades exactamente complementarias. matematica 03
transformación lineal T
Una función entre espacios vectoriales que respeta sumas y múltiplos: T(u+v) = T(u)+T(v) y T(αu) = αT(u). Toda matriz es una, y toda una tiene matriz. matematica 02
traza tr(A)
La suma de la diagonal de una matriz cuadrada. Es también la suma de sus eigenvalores. matematica 09
uniforme U
Distribución en la que todos los valores de un intervalo son igual de probables. La uniforme en [0,1] es el punto de partida de casi toda simulación. estadistica 02
valor p
La probabilidad de un efecto al menos tan grande como el observado, calculada suponiendo la hipótesis nula cierta. No es la probabilidad de que la nula sea cierta. estadistica 10
valores singulares σᵢ
Las entradas diagonales de Σ, que son las raíces de los eigenvalores de AᵀA. Miden cuánto estira la matriz en cada dirección principal; su número no nulo es el rango. matematica 11
variable aleatoria X
Una cantidad cuyo valor depende del resultado de un experimento aleatorio. Se escribe con mayúscula (X) para distinguirla de un valor concreto que tome (x). estadistica 01
varianza Var(X), σ²
La esperanza del cuadrado de la desviación respecto a la media: Var(X) = E[(X − μ)²]. Mide dispersión, en unidades al cuadrado. estadistica 04
varianza muestral
s² = (1/(n−1)) Σ (xᵢ − x̄)². Estima la varianza σ². El denominador n − 1 corrige el sesgo que introduce usar x̄ en lugar de la μ desconocida. estadistica 04
verosimilitud L(θ)
La probabilidad o densidad de los datos que se observaron, leída como función del parámetro con los datos fijos. No es una distribución sobre el parámetro: no integra uno. estadistica 08
verosimilitud marginal m(x)
La probabilidad de los datos promediada sobre el prior, m(x) = ∫p(x|θ)π(θ)dθ. Actualiza los pesos de una mezcla de priors y es con lo que se comparan modelos enteros. estadistica 19