Autovalores, descomposición espectral, SVD y PCA
Acá se ensambla toda la parte: el cambio de base, la covarianza como producto interno y las matrices simétricas se unen en una sola idea —encontrar las direcciones propias de una matriz—. Elegir la base correcta vuelve trivial una matriz complicada, y de ahí cae PCA.
Autovalores y autovectores
Casi toda dirección, al multiplicarla por , sale girada y estirada. Pero hay direcciones especiales que solo estira, sin rotar:
es un autovector y su autovalor (el factor de estiramiento). Movés y, sobre las rectas propias, vuelve a apuntar igual:
autovalores λ₁ = 2.15, λ₂ = 0.45
girá v hasta una recta roja: ahí Mv apunta igual que v
Un autovector es una dirección que la matriz **solo estira**, sin girarla: Mv = λv. Para casi todo v, el resultado Mv apunta distinto; pero sobre las rectas rojas coincide en dirección y solo cambia de largo por el factor λ (el autovalor). Como M es **simétrica**, sus dos autovectores son **perpendiculares** —el regalo del teorema espectral—.
Salen de la ecuación característica (los que hacen singular a , para que tenga solución no nula). Dos invariantes útiles: la traza es la suma de los autovalores () y el determinante su producto () —por eso algún no es invertible.
Diagonalización y descomposición espectral
Si juntás los autovectores como columnas de y los autovalores en una diagonal , la matriz se diagonaliza:
Es un cambio de base: lleva a la base propia, solo escala cada eje, y vuelve. Lo que era una transformación enredada se vuelve "estirar cada eje por su ". Y se vuelve trivial calcular potencias y funciones de matrices: (elevás los , nada más).
Para matrices simétricas —las covarianzas— pasa algo mejor, el teorema espectral:
los autovalores son reales y los autovectores ortonormales ( es una rotación, ). Equivalente, es una suma de rango 1, : la matriz se descompone en sus direcciones propias, cada una pesada por su autovalor. Esa ortogonalidad gratuita es la que hace funcionar a PCA.
La descomposición en valores singulares (SVD)
Los autovalores piden una matriz cuadrada (y "linda"). La SVD generaliza la idea a cualquier matriz de :
Toda transformación lineal es, entonces, rotar → estirar → rotar: rota la entrada, estira cada eje por un valor singular , y rota la salida. Los valores singulares son , y las columnas de y son los autovectores de y . La SVD da, gratis, el rango (número de ), la mejor aproximación de rango bajo (Eckart–Young: quedarse con los mayores es la compresión óptima) y la pseudoinversa para resolver mínimos cuadrados de forma estable.
Análisis de componentes principales (PCA)
El destino de toda la parte. Tenés datos correlacionados (muchas variables que se mueven juntas) y querés los ejes ortogonales de máxima varianza. Centrás los datos, formás la covarianza , y notás que la varianza a lo largo de una dirección unitaria es una forma cuadrática:
Entonces "dirección de máxima varianza" es . Y acá está la sorpresa que conecta todo: diagonalizando , el cociente es un promedio ponderado de los autovalores —que se maximiza poniendo todo el peso en el mayor—. O sea:
La dirección de máxima varianza es el autovector dominante de , y la varianza que captura es su autovalor. Las componentes principales son los autovectores de ordenados por autovalor decreciente —ortogonales de regalo por el teorema espectral—.
PC1 explica 93% de la varianza
PC1 es la dirección de **máxima varianza** de la nube; PC2, la perpendicular. No hay que pedir que sean ortogonales: son los autovectores de la covarianza Σ, y el teorema espectral los entrega perpendiculares de regalo. Cada autovalor es la varianza capturada por su eje; subí la correlación y mirá cómo la nube se alarga y PC1 se lleva casi todo —la base de reducir dimensión.
Cambiar a esa base es la rotación que endereza la elipse y descorrelaciona las variables; quedarse con los primeros ejes (los de mayor ) es reducir dimensión sin perder casi nada. Hay dos rutas para calcularlo: los autovectores de , o —numéricamente mejor— la SVD de los datos centrados ( da las componentes en directamente, sin formar ).
Cierre
Autovalores, espectro, SVD y PCA son la misma idea a profundidades crecientes: encontrar la base donde la matriz solo estira. Con esto, la parte de Álgebra lineal queda completa —de los espacios vectoriales a PCA—, y es la base sobre la que se paran la optimización (gradiente, Hessiano) y los modelos gaussianos multivariados.