Derivada, regla de la cadena y gradiente

Matemática · Lección 13

L2 Derivación Fase F1 Libro MML §5.1 · §5.2 Prereqs Producto interno

Objetivo

Al terminar esta lección se puede:

  1. Definir la derivada como límite del cociente de incrementos, y demostrar que toda función diferenciable es continua.
  2. Demostrar la regla de la cadena desde la definición, sin suponer que el incremento de la función interior nunca se anula.
  3. Definir la derivada parcial, la derivada direccional y el gradiente, y demostrar que, para una función diferenciable, la derivada direccional es el producto interno del gradiente con la dirección.
  4. Demostrar que el gradiente apunta hacia la dirección de máximo crecimiento y que su norma es la tasa de ese crecimiento, usando la desigualdad de Cauchy-Schwarz.

De dónde viene

  • Matemática 4: el producto interno y la desigualdad de Cauchy-Schwarz (Proposición 4.5), que aquí deciden en qué dirección crece más rápido una función.
  • Matemática 1: la base canónica e_1,\dots,e_n, usada para definir la derivada parcial como el caso particular de la derivada direccional en la dirección de un eje.

Para qué sirve después

  • Matemática 14 a 17: la Hessiana, la aproximación de Taylor y el descenso de gradiente —un algoritmo que en cada paso sigue exactamente la dirección de la Proposición 13.9—.
  • Estadística 8: el estimador de máxima verosimilitud se encuentra igualando a cero el gradiente de la log-verosimilitud.
  • Estadística 13: los coeficientes de mínimos cuadrados también se obtienen igualando a cero el gradiente de la suma de cuadrados.

Notación

Símbolo Se lee Significado
f'(a) f prima de a La derivada de f en el punto a
h hache El incremento; en toda esta lección tiende a cero
e_i e sub i El i-ésimo vector de la base canónica
\nabla f(a) gradiente de f en a El vector de las derivadas parciales de f en a
\partial f/\partial x_i derivada parcial de f respecto a x sub i La derivada de f moviendo solo la coordenada i
v uve Un vector unitario, \|v\|=1
D_vf(a) derivada direccional de f en a según v El límite de la razón de cambio de f en a en la dirección v
r(h) resto El error de la aproximación lineal; r(h)/\|h\|\to0

1. La derivada es un límite

Definición 13.1 (derivada). Sea f definida en un intervalo abierto que contiene a a\in\mathbb{R}. La derivada de f en a es f'(a) \;:=\; \lim_{h\to0}\frac{f(a+h)-f(a)}{h}, si ese límite existe. En ese caso se dice que f es diferenciable en a.

Proposición 13.2 (diferenciable implica continua). Si f es diferenciable en a, entonces f es continua en a.

Demostración. Para h\ne0, f(a+h)-f(a) = \frac{f(a+h)-f(a)}{h}\cdot h. Cuando h\to0, el primer factor tiende a f'(a) por hipótesis, y el segundo tiende a 0; el límite del producto es el producto de los límites, así que f(a+h)-f(a)\to f'(a)\cdot 0=0, es decir f(a+h)\to f(a). Eso es continuidad en a.

El recíproco es falso —|x| es continua en 0 y no diferenciable ahí—, y por eso el orden de la Proposición 13.2 no se invierte: hace falta un poco más que continuidad para poder hablar de pendiente.

El cociente de incrementos se acerca a la derivada exacta a medida que h se reduce: con h=0{,}0001 el error ya es menor que una milésima. La celda mide exactamente lo que dibuja el visual: la secante convirtiéndose en tangente.

2. La regla de la cadena

Proposición 13.3 (regla de la cadena). Sea g diferenciable en a y f diferenciable en b:=g(a). Entonces f\circ g es diferenciable en a y (f\circ g)'(a) = f'(g(a))\cdot g'(a).

Demostración. Como f es diferenciable en b, defínase \varphi(k) = \begin{cases}\dfrac{f(b+k)-f(b)}{k} & k\ne0\\[4pt] f'(b) & k=0.\end{cases} Por la Definición 13.1, \varphi(k)\to f'(b)=\varphi(0) cuando k\to0: \varphi es continua en 0. Además, para todo k —incluido k=0, donde ambos lados son cero—, f(b+k)-f(b) = \varphi(k)\cdot k. \tag{$\ast$}

Sea k(h):=g(a+h)-g(a). Por la Proposición 13.2, g es continua en a, así que k(h)\to0 cuando h\to0. Sustituyendo k=k(h) en (\ast), f(g(a+h))-f(g(a)) = f(b+k(h))-f(b) = \varphi(k(h))\cdot k(h). Dividiendo entre h\ne0, \frac{f(g(a+h))-f(g(a))}{h} = \varphi(k(h))\cdot\frac{g(a+h)-g(a)}{h}. Cuando h\to0: k(h)\to0 y \varphi es continua en 0, luego \varphi(k(h))\to\varphi(0)=f'(g(a)); y el segundo factor tiende a g'(a) por definición. El límite del producto es el producto de los límites: (f\circ g)'(a) = f'(g(a))\cdot g'(a). \;\;[\blacksquare]

La función auxiliar \varphi es lo que evita el problema de siempre: si se divide f(g(a+h))-f(g(a)) entre g(a+h)-g(a) directamente, esa expresión no está definida cuando g(a+h)=g(a), y con g constante en un entorno de a eso pasa en cada h. La igualdad (\ast) es válida incluso con k=0, así que la demostración no necesita descartar ese caso.

3. Muchas variables: derivada parcial, direccional y gradiente

Definición 13.4 (derivada parcial). Sea f definida en un abierto de \mathbb{R}^n que contiene a a. La derivada parcial de f respecto a x_i en a es \frac{\partial f}{\partial x_i}(a) \;:=\; \lim_{h\to0}\frac{f(a+he_i)-f(a)}{h}, si el límite existe: la derivada ordinaria de la función de una variable que se obtiene moviendo solo la coordenada i-ésima.

Definición 13.5 (gradiente). Si existen las n derivadas parciales de f en a, el gradiente de f en a es el vector \nabla f(a) := \Big(\frac{\partial f}{\partial x_1}(a),\dots,\frac{\partial f}{\partial x_n}(a)\Big).

Definición 13.6 (derivada direccional). Para un vector unitario v (\|v\|=1), la derivada direccional de f en a según v es D_vf(a) := \lim_{h\to0}\frac{f(a+hv)-f(a)}{h}, si el límite existe. En particular D_{e_i}f(a)=\partial f/\partial x_i(a): la derivada parcial es la derivada direccional en la dirección de un vector de la base canónica.

Definición 13.7 (diferenciabilidad multivariable). f es diferenciable en a si existe un vector c\in\mathbb{R}^n tal que f(a+h) = f(a) + c\cdot h + r(h), \qquad \text{con } \frac{r(h)}{\|h\|}\to0 \text{ cuando } h\to0. Es decir, f admite en a una aproximación lineal cuyo error se hace despreciable frente a la distancia \|h\| al punto.

Proposición 13.8 (el gradiente es esa aproximación). Si f es diferenciable en a según la Definición 13.7, el vector c es único, existen las n derivadas parciales de f en a, y c=\nabla f(a). Además, para todo vector unitario v —no solo los de la base canónica—, D_vf(a) = \nabla f(a)\cdot v.

Demostración. Fíjese i y tómese h=te_i con t\to0, t\ne0. Como \|te_i\|=|t|, la Definición 13.7 da \frac{f(a+te_i)-f(a)}{t} = c_i + \frac{r(te_i)}{t}, \qquad \Big|\frac{r(te_i)}{t}\Big| = \frac{|r(te_i)|}{\|te_i\|}\to0. El lado izquierdo tiende entonces a c_i; pero por la Definición 13.4 también tiende a \partial f/\partial x_i(a). Los límites son únicos, así que \partial f/\partial x_i(a)=c_i para cada i: existen las n derivadas parciales, y c es exactamente \nabla f(a) de la Definición 13.5. Eso prueba a la vez la unicidad de c, porque un límite que existe tiene un solo valor.

Para la fórmula general, tómese ahora h=tv con v unitario arbitrario y t\to0. El mismo argumento da \frac{f(a+tv)-f(a)}{t} = c\cdot v + \frac{r(tv)}{t} \;\longrightarrow\; c\cdot v = \nabla f(a)\cdot v, porque \|tv\|=|t| y r(tv)/\|tv\|\to0. El lado izquierdo es, por la Definición 13.6, D_vf(a). Luego D_vf(a)=\nabla f(a)\cdot v.

La Proposición 13.8 es la que hace útil al gradiente: convierte una derivada direccional —un límite distinto para cada una de infinitas direcciones— en un solo producto interno.

4. El gradiente apunta hacia donde más crece

Proposición 13.9 (dirección de máximo crecimiento). Sea f diferenciable en a con \nabla f(a)\ne0. Entre todos los vectores unitarios v, D_vf(a) alcanza su máximo cuando v=\nabla f(a)/\|\nabla f(a)\|, con valor \|\nabla f(a)\|; y su mínimo cuando v=-\nabla f(a)/\|\nabla f(a)\|, con valor -\|\nabla f(a)\|.

Demostración. Por la Proposición 13.8, D_vf(a)=\nabla f(a)\cdot v. Por la Proposición 4.5 (Cauchy-Schwarz), |\nabla f(a)\cdot v| \le \|\nabla f(a)\|\,\|v\| = \|\nabla f(a)\|, porque v es unitario. Ningún valor de D_vf(a) supera \|\nabla f(a)\| en valor absoluto, sea cual sea v. La misma proposición dice que la igualdad se da exactamente cuando v es múltiplo de \nabla f(a); como además \|v\|=1, ese múltiplo solo puede ser \pm\nabla f(a)/\|\nabla f(a)\|. Sustituyendo el signo +, \nabla f(a)\cdot\frac{\nabla f(a)}{\|\nabla f(a)\|} = \frac{\|\nabla f(a)\|^2}{\|\nabla f(a)\|} = \|\nabla f(a)\|, que por la cota es el máximo posible; y el signo - da el valor opuesto, que por la misma cota es el mínimo posible.

Nada de esto pide calcular una derivada nueva: la Proposición 4.5 ya estaba demostrada, y aquí solo decide un signo.

Entre 4000 direcciones muestreadas al azar, la que más hace crecer a f coincide con el gradiente normalizado, y la que más lo hace decrecer es su opuesta: exactamente lo que dice la Proposición 13.9, medido en vez de solo enunciado.

Ejercicios

Ejercicio 1 — La regla del producto, sin memorizarla

Demostrar, a partir de la Definición 13.1, la regla del producto (fg)'(a)=f'(a)g(a)+f(a)g'(a), sumando y restando f(a+h)g(a) en el numerador del cociente de incrementos de fg. Comprobar el resultado para f(x)=x^2 y g(x)=\operatorname{sen}(x).

Ejercicio 2 — El plano tangente es mejor que cualquier otro

El plano tangente a la gráfica de f en a es z=f(a)+\nabla f(a)\cdot(x-a). La Definición 13.7 dice que su error es o(\|h\|): se hace pequeño más rápido que \|h\|. Comprobarlo contra un plano que use un vector cercano al gradiente pero no igual, y observar que ese segundo error no se acelera de la misma forma.

El error del plano tangente dividido entre t se va a cero con t: el error de verdad es O(t^2). El del plano falso se estabiliza en 0{,}3 —exactamente |(c_{\text{falso}}-\nabla f(a))\cdot u|=|0{,}5\cdot 0{,}6|—, porque ese plano difiere del tangente en una dirección que u sí detecta. Ser tangente exige coincidir exactamente con el gradiente, no solo estar cerca de él.

Reto

En proyectos/notebooks/F1-retos.ipynb, sección Mat 13:

  1. Escribir derivada_parcial(f, a, i, h=1e-6) que aproxime \partial f/\partial x_i(a) por diferencia central, y verificarla contra grad_f a mano para al menos tres funciones y tres puntos.
  2. Reproducir el Ejercicio 2 con una función distinta —por ejemplo f(x,y)=e^{x}\cos(y)— y encontrar en qué potencia de t se estabiliza el error del plano tangente dividido entre t^2 en vez de entre t.
  3. Implementar el descenso de gradiente más simple —a_{k+1}=a_k-\eta\nabla f(a_k)— sobre f(x,y)=0{,}4(x-0{,}6)^2+0{,}9(y+0{,}4)^2 del segundo visual, y comprobar que la trayectoria, vista desde cualquier punto de partida, cruza cada curva de nivel perpendicularmente. Anotar en 50-Errores/ qué pasa con \eta demasiado grande.

Del libro

Mathematics for Machine Learning dedica el capítulo 5, Vector Calculus, a este material: §5.1 Differentiation of Univariate Functions trata la derivada de una variable, y §5.2 Partial Differentiation and Gradients la extiende a varias. El libro tiene copyright y no es descargable desde el entorno en que se escribió esta página, así que se cita número y título y no se le atribuye ninguna frase.

Preguntas para leer §5.1 y §5.2 con lápiz:

  1. §5.1 recorre las reglas de derivación de una variable —suma, producto, cociente, potencia— además de la regla de la cadena. Con el mismo argumento de la Proposición 13.3 (la función auxiliar continua en el punto), demostrar la regla del cociente (f/g)'(a)=[f'(a)g(a)-f(a)g'(a)]/g(a)^2 para g(a)\ne0.
  2. §5.2 introduce el gradiente exactamente como la Definición 13.5 de esta página: el vector de las n derivadas parciales. Comprobar que, si f depende de una sola coordenada, esa definición colapsa en la derivada ordinaria de la Definición 13.1.
  3. El resto del capítulo 5 —gradientes de funciones vectoriales, retropropagación— encadena exactamente lo que aquí son la Proposición 13.3 y la Proposición 13.8. Adelantar qué forma tendría la derivada de f(g(t)) si g:\mathbb{R}\to\mathbb{R}^n y f:\mathbb{R}^n\to\mathbb{R}.

Para el Cerebro

Nota nueva en 10-Conceptos/derivada-y-gradiente.md, enlazada a [[producto-interno]], [[hessiana]] y [[descenso-de-gradiente]]. Conviene rehacer a mano la demostración de la Proposición 13.3: la función auxiliar \varphi es la idea que evita el caso incómodo de g(a+h)=g(a), y reaparece cada vez que se deriva una composición con cuidado.

¿Qué es la derivada de f en a?::El límite del cociente [f(a+h)-f(a)]/h cuando h tiende a cero
¿Diferenciable implica continua, o al revés?::Diferenciable implica continua; el recíproco es falso (|x| en 0)
¿Qué evita la funcion auxiliar φ en la regla de la cadena?::Dividir por g(a+h)-g(a), que puede valer cero
¿Qué es la derivada parcial?::La derivada ordinaria de f moviendo solo una coordenada, las demás fijas
¿Qué es el gradiente?::El vector de las n derivadas parciales, ∇f(a)
¿Qué es la derivada direccional D_v f(a)?::La tasa de cambio de f en a en la dirección unitaria v
¿Cómo se relaciona D_v f(a) con el gradiente?::D_v f(a) = ∇f(a)·v, si f es diferenciable en a
¿En qué dirección crece más rápido f?::En la del gradiente normalizado, ∇f(a)/‖∇f(a)‖
¿Cuánto vale la máxima derivada direccional?::‖∇f(a)‖; el mínimo es -‖∇f(a)‖, en la dirección opuesta
¿Qué desigualdad decide la Proposición 13.9?::Cauchy-Schwarz (Proposición 4.5) y su condición de igualdad

Fuentes

Lo que esta página demuestra sola. Las Proposiciones 13.2, 13.3, 13.8 y 13.9 se demuestran aquí desde la Definición 13.1 y desde la desigualdad de Cauchy-Schwarz de la lección 4. Se comprueban además numéricamente: la convergencia del cociente de incrementos a la derivada exacta en seis escalas de h; la regla de la cadena contra diferencia finita en 500 puntos; la fórmula D_vf(a)=\nabla f(a)\cdot v contra diferencia finita en 2000 direcciones; que la dirección que maximiza D_vf(a) entre 4000 muestreadas coincide con el gradiente normalizado y que el máximo vale su norma; la regla del producto en 500 puntos; y que el error del plano tangente cae con t^2 mientras el de un plano cercano pero distinto se estabiliza en un valor no nulo. Los dos visuales se contrastaron antes de publicarse contra las fórmulas en todo el rango de sus controles.

Lo que se usa de otras lecciones sin repetir. La desigualdad de Cauchy-Schwarz y su condición de igualdad son la Proposición 4.5. La base canónica e_1,\dots,e_n es de la lección 1.

Lo que se enuncia sin demostrar. Que el límite de un producto es el producto de los límites, usado dos veces (Proposiciones 13.2 y 13.3), es un resultado de cálculo de una variable que se da por conocido. La regla del producto, del cociente y las demás reglas elementales de derivación no se demuestran aquí: se proponen como ejercicio con el mismo método que la regla de la cadena.

Lo que viene de los libros.

  • Mathematics for Machine Learning (Deisenroth, Faisal & Ong, Cambridge University Press, 2020), §5.1 Differentiation of Univariate Functions y §5.2 Partial Differentiation and Gradients — citadas por número y título, sin transcribir texto.

Lo que es mío, no del libro. La demostración de la regla de la cadena mediante la función auxiliar \varphi, presentada para que la Definición 13.7 y la Proposición 13.8 encajen sin fisuras con lo que sigue en Matemática 14 en adelante. La Proposición 13.9 como consecuencia directa —sin demostración nueva— de la desigualdad de Cauchy-Schwarz ya probada en la lección 4. El Ejercicio 2, construido para hacer visible la diferencia entre “cercano al gradiente” y “el gradiente”.

Índices verificados el 12-09-2026 contra el índice publicado del PDF oficial.

→ Siguiente: Hessiana y expansión de Taylor