OpenBetaMatemática

← Temas

Varias variables: gradiente, jacobiano y hessiano

En una variable, la derivada era un número: la pendiente. En varias variables, f:RnRmf : \mathbb{R}^n \to \mathbb{R}^m, la derivada se vuelve un mapa lineal —una matriz—. Toda la riqueza del capítulo está ahí: el objeto que mejor aproxima localmente a ff ya no es una recta, sino una transformación lineal. Tres versiones de esa idea organizan todo: gradiente, jacobiano y hessiano.

La derivada como mapa lineal

La derivada total de ff en aa es la mejor aproximación lineal:

f(a+h)f(a)+Df(a)h,f(a + h) \approx f(a) + Df(a)\,h,

donde Df(a)Df(a) es una matriz que actúa sobre el incremento hh. Sus entradas son las derivadas parciales fixj\frac{\partial f_i}{\partial x_j} (derivar respecto de una variable tratando las otras como constantes). Según la forma de ff, esa matriz recibe distinto nombre.

Cuidado: tener todas las parciales no es ser diferenciable. Las parciales solo miran las direcciones de los ejes. La función f(x,y)=xyx2+y2f(x,y) = \frac{xy}{x^2+y^2} (con f(0,0)=0f(0,0)=0) tiene ambas parciales nulas en el origen —vale 00 sobre los ejes— pero ni siquiera es continua ahí: sobre la recta y=xy = x vale 12\tfrac12. La diferenciabilidad exige buena aproximación lineal en todas las direcciones a la vez. (Sí alcanza, en cambio, que las parciales sean continuas en un entorno.)

El gradiente — la dirección de máximo ascenso

Para una función escalar f:RnRf : \mathbb{R}^n \to \mathbb{R}, la derivada es un vector, el gradiente:

f=(fx1,,fxn).\nabla f = \left( \frac{\partial f}{\partial x_1}, \dots, \frac{\partial f}{\partial x_n} \right).

Su magia: la derivada direccional en una dirección unitaria uu es Duf=fuD_u f = \nabla f \cdot u, que se maximiza cuando uu apunta como f\nabla f. O sea, f\nabla f apunta hacia donde ff crece más rápido, y es perpendicular a las curvas de nivel (moverse a lo largo de una curva de nivel no cambia ff, así que no tiene componente del gradiente). Movelo:

El gradiente ∇f — interactivobandas = curvas de nivel
En el punto, ∇f = (0.79, -0.07). La flecha apunta en la dirección de máximo crecimiento y es perpendicular a la curva de nivel (el borde entre dos bandas). Su longitud, |∇f| = 0.79, mide la pendiente: corta donde el terreno es plano, larga donde es empinado.

La derivada direccional en una dirección u es ∇f·u: máxima cuando u apunta como ∇f.

Por eso el descenso por gradiente se mueve en dirección f-\nabla f: cuesta abajo, lo más rápido posible. La derivada que en una variable era "la pendiente" acá es "la dirección y la pendiente".

El jacobiano — el mapa lineal local

Para f:RnRmf : \mathbb{R}^n \to \mathbb{R}^m, la derivada es la matriz completa de parciales, el jacobiano:

Jf=[f1x1f1xnfmx1fmxn].J_f = \begin{bmatrix} \dfrac{\partial f_1}{\partial x_1} & \cdots & \dfrac{\partial f_1}{\partial x_n} \\ \vdots & & \vdots \\ \dfrac{\partial f_m}{\partial x_1} & \cdots & \dfrac{\partial f_m}{\partial x_n} \end{bmatrix}.

Es el mapa lineal que mejor imita a ff cerca del punto: manda un cuadradito a un paralelogramo (en 3D, un cubito a un paralelepípedo). Sus columnas son las imágenes de los vectores base:

El Jacobiano como mapa lineal local — interactivoT(x,y) = (x + 0.4 sin y, y + 0.4 sin x)
J = [ 1.00   0.35 ]
    [ 0.33   1.00 ]
El Jacobiano es el mejor mapa lineal que aproxima a T cerca del punto: manda un cuadradito (gris) al paralelogramo azul. Sus columnas son las imágenes de los vectores base. El determinante det J = 0.88 es cuánto se escala el área localmente — el factor del cambio de variable.

Dos consecuencias enormes. Primero, detJf\lvert \det J_f \rvert es cuánto escala el área (o el volumen) localmente —es el factor del cambio de variable en integrales múltiples, dV=detJdVdV' = \lvert\det J\rvert\,dV. Segundo, la regla de la cadena se vuelve producto de matrices:

Jgf(a)=Jg(f(a))Jf(a).J_{g \circ f}(a) = J_g\bigl(f(a)\bigr)\, J_f(a).

El gradiente es el caso m=1m = 1: f\nabla f es el jacobiano de una función escalar (una matriz 1×n1 \times n). El jacobiano es el corazón de la linealización, de Gauss–Newton (jacobiano de los residuos) y de la propagación de incertidumbre Σ=JΣJ\Sigma' = J\,\Sigma\,J^\top.

Deshacer y despejar: función inversa e implícita

El determinante del jacobiano no solo escala volumen: decide si ff se puede invertir localmente.

Teorema de la función inversa. Si f:RnRnf : \mathbb{R}^n \to \mathbb{R}^n es C1C^1 y detJ(p)0\det J(p) \neq 0, entonces cerca de pp la función es biyectiva, su inversa es C1C^1, y (f1)(f(p))=J(p)1(f^{-1})'(f(p)) = J(p)^{-1} —la versión matricial del 1/f1/f' de una variable.

La intuición: detJ(p)0\det J(p) \neq 0 significa que la aproximación lineal no aplasta el espacio (manda un cubito a un paralelepípedo de volumen positivo, no a algo degenerado), así que localmente ff se comporta como una transformación lineal invertible. La prueba reduce f(x)=yf(x) = y a un punto fijo φy(x)=x+A1(yf(x))\varphi_y(x) = x + A^{-1}(y - f(x)) y muestra que es una contracción —de ahí la solución única, vía la completitud de Rn\mathbb{R}^n—. Es local: en polares f(r,θ)=(rcosθ,rsinθ)f(r,\theta) = (r\cos\theta,\, r\sin\theta) tiene detJ=r0\det J = r \neq 0, pero θ\theta y θ+2π\theta + 2\pi dan el mismo punto: invertible cerca, no globalmente.

Teorema de la función implícita. Dada F(x,y)=0F(x,y) = 0 con FF de clase C1C^1, si Fy0\frac{\partial F}{\partial y} \neq 0 en un punto, entonces localmente existe y=g(x)y = g(x) de clase C1C^1 con F(x,g(x))=0F(x, g(x)) = 0 —aunque no haya fórmula explícita—, y g(x)=F/xF/yg'(x) = -\dfrac{\partial F/\partial x}{\partial F/\partial y}.

Es un corolario del anterior (aplicado a (x,y)(x,F(x,y))(x,y) \mapsto (x, F(x,y)), cuyo jacobiano tiene determinante F/y\partial F/\partial y). El círculo x2+y2=1x^2 + y^2 = 1 lo ilustra: globalmente no define y=g(x)y = g(x) (dos ramas), pero localmente sí donde F/y=2y0\partial F/\partial y = 2y \neq 0; falla exactamente en (±1,0)(\pm 1, 0), donde la tangente es vertical y las ramas se juntan. Inversa e implícita son hermanas: un determinante (o una derivada) no nulo garantiza que localmente se puede invertir o despejar, porque nada colapsó.

El hessiano — curvatura y óptimos

El gradiente es la primera derivada; la segunda es la matriz de derivadas parciales segundas, el hessiano:

H=[2fx122fx1xn2fxnx12fxn2].H = \begin{bmatrix} \dfrac{\partial^2 f}{\partial x_1^2} & \cdots & \dfrac{\partial^2 f}{\partial x_1 \partial x_n} \\ \vdots & & \vdots \\ \dfrac{\partial^2 f}{\partial x_n \partial x_1} & \cdots & \dfrac{\partial^2 f}{\partial x_n^2} \end{bmatrix}.

Es simétrico (teorema de Clairaut–Schwarz: el orden de derivación no importa). Aparece en el Taylor de segundo orden:

f(a+h)f(a)+f(a)h+12hH(a)h.f(a + h) \approx f(a) + \nabla f(a)^\top h + \tfrac{1}{2}\, h^\top H(a)\, h .

En un punto crítico (f=0\nabla f = 0) el término lineal se anula y manda el hessiano: la forma cuadrática hHhh^\top H h decide si es mínimo, máximo o silla, según el signo de los autovalores de HH. Jugá con la forma:

El Hessiano y los puntos críticos — interactivomínimo (cuenco)
H = [ 1.0   0.5 ]
    [ 0.5   1.0 ]
λ₁ = 1.50
λ₂ = 0.50
det = 0.75
traza = 2.00

En un punto crítico, el Hessiano decide: ambos autovalores > 0 → cuenco (mínimo); ambos < 0 → cúpula (máximo); signos opuestos → silla. El atajo: det H > 0 y a > 0 → mínimo; det H < 0 → silla. Es el test de la segunda derivada, en matriz.

Autovalores ambos positivos (HH definida positiva) → mínimo (cuenco); ambos negativos → máximo (cúpula); signos opuestossilla. En 2D el atajo es el test de la segunda derivada: detH>0\det H > 0 y fxx>0f_{xx} > 0 \Rightarrow mínimo; detH<0\det H < 0 \Rightarrow silla.

El hessiano es el jacobiano del gradiente, H=JfH = J_{\nabla f}, lo que cierra el círculo: gradiente → jacobiano → hessiano son la misma idea aplicada una y otra vez.

Por qué esto es la caja de herramientas de la optimización

Las tres piezas son, literalmente, la optimización moderna:

  • Gradiente → descenso por gradiente: xk+1=xkηfx_{k+1} = x_k - \eta\,\nabla f.
  • Hessiano → método de Newton: xk+1=xkH1fx_{k+1} = x_k - H^{-1}\nabla f, que usa la curvatura para dar el paso óptimo (y converge cuadráticamente cerca del óptimo).
  • Convexidad = H0H \succeq 0 en todo el dominio: garantiza que el mínimo local es global —la propiedad que vuelve confiable la optimización convexa.
  • En estadística, la información de Fisher es E[H]-E[H] de la log-verosimilitud: la curvatura de la verosimilitud mide cuánta información traen los datos, y su inversa es la covarianza asintótica del estimador.

De la pendiente en un punto pasamos a una matriz que codifica dirección, escala y curvatura. La derivada creció hasta volverse álgebra lineal —y ahí vive casi toda la optimización moderna.