Producto interno, proyecciones y mínimos cuadrados
Hasta acá el espacio vectorial no tenía geometría: podías sumar y escalar, pero no medir longitudes ni ángulos. El producto interno agrega exactamente eso —y con él aparece la idea más rentable de toda el área: la proyección, que es mínimos cuadrados, regresión y esperanza condicional, todo a la vez. La revelación de fondo: la covarianza es un producto interno entre variables y la correlación es el coseno del ángulo entre ellas.
El producto interno: geometría
En es el producto punto de siempre, . Pero lo que importa no es la fórmula sino las tres propiedades que cumple —cualquier operación que las cumpla es un producto interno y hereda toda la geometría:
- Simetría: .
- Linealidad: .
- Definida positiva: , con igualdad solo si .
La última es la clave: garantiza que tenga raíz real, que es la longitud:
Cauchy–Schwarz y el ángulo
Para que el coseno de un ángulo caiga en hace falta una desigualdad —la Cauchy–Schwarz, una de las más importantes de la matemática:
Prueba (completando el cuadrado). Para todo escalar , la definición positiva da . Es una cuadrática en que nunca es negativa; su mínimo (en ) vale , que reordenado es la desigualdad. (Ese es, además, el coeficiente de proyección de abajo.)
Con eso, el cociente está garantizado en y define el ángulo:
La revelación. Si el "producto interno" entre variables centradas es la covarianza , entonces la longitud es la desviación estándar () y el coseno es la correlación . Cauchy–Schwarz dice, en ese lenguaje, que .
Ortogonalidad y proyección
El caso estrella es el ángulo de : como , dos vectores son ortogonales exactamente cuando (en probabilidad: incorrelados). Y ahí vuelve Pitágoras: si , .
La proyección de sobre la dirección de —su mejor aproximación usando solo esa dirección— es
y su propiedad definitoria es que el residual es ortogonal a . Esa frase —"mejor aproximación, error perpendicular"— es, literalmente, mínimos cuadrados y esperanza condicional. Miralo:
cos θ = ⟨u,v⟩/(‖u‖‖v‖) = 0.73 (θ ≈ 43.26°)
proy_v(u) = (⟨u,v⟩/‖v‖²)·v
La proyección de u sobre la dirección de v es su mejor aproximación usando solo esa dirección, y el residual (lo que sobra) es siempre perpendicular a v —ese ángulo recto es la firma—. Esa única idea —"mejor aproximación + error ortogonal"— es el germen de los mínimos cuadrados y de la esperanza condicional. El coseno del ángulo es, además, la correlación cuando el producto interno es la covarianza.
Bases ortonormales. Cuando los vectores de una base son perpendiculares y de longitud , hallar coordenadas es gratis: en vez de invertir una matriz (como en el cambio de base), las coordenadas son simples productos internos, .
Mínimos cuadrados: el punto más cercano
¿Qué hacés cuando no tiene solución porque sobresale del espacio columna (datos con ruido, más ecuaciones que incógnitas)? Te quedás con lo más cerca posible: proyectás sobre el plano alcanzable. Y ese punto ortogonal es el más cercano —por Pitágoras:
Sea con . Para cualquier otro : , porque es ortogonal a . La proyección minimiza la distancia.
"Residual ortogonal a todo el subespacio" equivale a "ortogonal a cada columna", , las ecuaciones normales:
(cuando las columnas son independientes, así es invertible). La matriz de proyección es idempotente (: proyectar lo ya proyectado no lo mueve) y simétrica.
OLS es esto, y el R² es un ángulo
Cambiá las etiquetas — (regresores), , — y aparece toda la regresión lineal:
es la matriz sombrero: el ajuste es la proyección de las observaciones sobre el espacio columna, y las ecuaciones normales dicen, palabra por palabra, "los residuales no correlacionan con ningún predictor". Con datos centrados, Pitágoras da (total = explicada + residual), y
el coseno al cuadrado del ángulo entre y el espacio columna. Movés la pendiente y mirás el SSE crecer fuera del óptimo:
SSE(m) = 0.32
mínimo en m = β̂ = 0.64 → SSE = 0.32
R² = ‖ŷ‖²/‖y‖² = cos²θ = 0.98
estás en la recta de mínimos cuadrados: SSE es mínimo
La recta de mínimos cuadrados es la que hace mínima la suma de los residuales al cuadrado —proyectar las observaciones sobre lo que los regresores pueden alcanzar—. En el mínimo, los residuales son **perpendiculares** al regresor (las ecuaciones normales). Y el R² es cos²θ: qué tan alineadas están las observaciones con el espacio columna —1 si caen justo en la recta, 0 si son ortogonales—.
Multicolinealidad. Si las columnas de son dependientes, es singular (): hay infinitos con idéntico ajuste. La proyección siempre existe y es única (es geometría); lo que no es único es la receta . Ridge suma para volver invertible y fijar una solución.
Matrices simétricas y definidas positivas
La proyección dejó a la vista una clase de matrices que reaparece sin parar: . Siempre es simétrica () y semidefinida positiva, porque . Es exactamente la forma de una matriz de covarianza.
Una forma cuadrática con simétrica es definida positiva si para todo —el análogo de "" en una parábola—, lo que equivale a que todos sus autovalores sean positivos. Esa positividad es lo que garantiza que una covarianza describa una nube real (un elipsoide con volumen) y que su factorización de Cholesky exista, la forma estándar de "sacarle la raíz" a una matriz.
Lo que sigue
La frase "todos sus autovalores son positivos" abre la última puerta: autovalores, descomposición espectral, SVD y PCA —las direcciones propias de una matriz simétrica, y cómo diagonalizarla para volver círculos las elipses.