← Temas
Podrías derivar cualquier expresión vectorial bajando a componentes —escribir las sumas,
derivar cada xi, recolectar—, pero es lento y opaco. El cálculo matricial da reglas
para derivar formas como a⊤x o x⊤Ax de un
vistazo, tratando los vectores como un todo. Y la sorpresa tranquilizadora: es un espejo
del cálculo escalar que ya dominás.
La convención: el gradiente tiene la forma de x
La derivada de un escalar f respecto de un vector x es un vector de la misma
forma que x, con entrada i igual a ∂f/∂xi —es el
gradiente—:
∂x∂f=∇f=(∂x1∂f,…,∂xn∂f)⊤.
Las cuatro identidades
Cubren el 90% de lo que vas a necesitar. Después de cada una, su gemela escalar —para que
veas que no son reglas nuevas—.
1 · Forma lineal. ∇(a⊤x)=a. Como
a⊤x=∑iaixi, derivar en xj deja solo aj. (Escalar:
dxd(ax)=a.)
2 · Norma al cuadrado. ∇(x⊤x)=2x. Como
x⊤x=∑ixi2, derivar en xj da 2xj. (Escalar:
dxd(x2)=2x.)
3 · Forma cuadrática (la clave). ∇(x⊤Ax)=(A+A⊤)x=2Ax
si A es simétrica. En ∑i,jAijxixj, la variable xk aparece como xi
y como xj; derivando salen (Ax)k+(A⊤x)k. (Escalar:
dxd(ax2)=2ax.) Es la identidad de cada exponente gaussiano y cada varianza
cuadrática.
4 · Mínimos cuadrados. ∇∥Ax−b∥2=2A⊤(Ax−b).
Expandiendo ∥Ax−b∥2=x⊤A⊤Ax−2b⊤Ax+b⊤b
y aplicando las identidades 3 (A⊤A simétrica) y 1.
El espejo, lado a lado:
| Expresión | Gradiente | Gemela escalar |
|---|
| a⊤x | a | dxd(ax)=a |
| x⊤x | 2x | dxd(x2)=2x |
| x⊤Ax | 2Ax (sim.) | dxd(ax2)=2ax |
| ∥Ax−b∥2 | 2A⊤(Ax−b) | (combinación) |
Donde el escalar tiene a, 2x, 2ax, el matricial tiene a, 2x,
2Ax: las de siempre, con matrices en lugar de números.
El pago: OLS en tres líneas
La regresión minimiza ∥Xβ−y∥2; el mínimo está donde
el gradiente se anula (identidad 4):
∇∥Xβ−y∥2=2X⊤(Xβ−y)=0⟹X⊤Xβ^=X⊤y⟹β^=(X⊤X)−1X⊤y.
Dos caminos al mismo lugar. En proyecciones
obtuviste las ecuaciones normales por geometría (residual ⊥ espacio columna); acá por
cálculo (gradiente cero). Coinciden porque el mínimo de una distancia es a la vez
"no se puede bajar más" (gradiente cero) y "perpendicularidad". El error
∥Xβ−y∥2 es un cuenco convexo (X⊤X
definida positiva) y resolver OLS es hallar su fondo.
Ridge sale igual: derivando ∥Xβ−y∥2+λ∥β∥2,
el término λ∥β∥2 aporta 2λβ
(identidad 2), y queda β^=(X⊤X+λI)−1X⊤y
—el +λI que vuelve invertible la matriz—.
El exponente gaussiano
El otro pago directo. La log-densidad gaussiana tiene el exponente
−21(x−μ)⊤Σ−1(x−μ);
derivarlo en x es la identidad 3 (con A=Σ−1, simétrica):
∇x[−21(x−μ)⊤Σ−1(x−μ)]=−Σ−1(x−μ).
Igualar a cero da x=μ: la densidad tiene su pico en la media.
Y derivando en μ y sumando sobre los datos sale la ecuación del MLE de la
media. Estas identidades son las que te dejan calcular la score
∇θlogL=0 a mano para modelos gaussianos y lineales,
en vez de derivar numéricamente.
Recall activo
- ¿Cuánto vale ∇(a⊤x)? ¿Y ∇(x⊤x)?
- Derivá ∇(x⊤Ax) con A simétrica. ¿La gemela escalar?
- Derivá las ecuaciones normales de OLS igualando un gradiente a cero.
- ¿Por qué Ridge produce (X⊤X+λI)−1?
Soluciones: (1) a y 2x; (2) 2Ax, gemela dxd(ax2)=2ax;
(3) 2X⊤(Xβ^−y)=0⇒X⊤Xβ^=X⊤y;
(4) el término λ∥β∥2 deriva a 2λβ
(identidad 2), que suma λI dentro de la matriz a invertir.
Con esto, derivar un estimador deja de ser cálculo a ciegas y se vuelve reconocer
patrones: casi todo MLE gaussiano o lineal es la identidad 3 aplicada a un exponente
cuadrático.