OpenBetaMatemática

← Temas

Producto interno, proyecciones y mínimos cuadrados

Hasta acá el espacio vectorial no tenía geometría: podías sumar y escalar, pero no medir longitudes ni ángulos. El producto interno agrega exactamente eso —y con él aparece la idea más rentable de toda el área: la proyección, que es mínimos cuadrados, regresión y esperanza condicional, todo a la vez. La revelación de fondo: la covarianza es un producto interno entre variables y la correlación es el coseno del ángulo entre ellas.

El producto interno: geometría

En Rn\mathbb{R}^n es el producto punto de siempre, u,v=uv=iuivi\langle \mathbf{u}, \mathbf{v}\rangle = \mathbf{u}^\top\mathbf{v} = \sum_i u_i v_i. Pero lo que importa no es la fórmula sino las tres propiedades que cumple —cualquier operación que las cumpla es un producto interno y hereda toda la geometría:

  • Simetría: u,v=v,u\langle \mathbf{u}, \mathbf{v}\rangle = \langle \mathbf{v}, \mathbf{u}\rangle.
  • Linealidad: au+bw,v=au,v+bw,v\langle a\mathbf{u} + b\mathbf{w}, \mathbf{v}\rangle = a\langle \mathbf{u}, \mathbf{v}\rangle + b\langle \mathbf{w}, \mathbf{v}\rangle.
  • Definida positiva: v,v0\langle \mathbf{v}, \mathbf{v}\rangle \ge 0, con igualdad solo si v=0\mathbf{v} = \mathbf{0}.

La última es la clave: garantiza que v,v\langle \mathbf{v}, \mathbf{v}\rangle tenga raíz real, que es la longitud:

v=v,v,distancia(u,v)=uv.\lVert \mathbf{v}\rVert = \sqrt{\langle \mathbf{v}, \mathbf{v}\rangle}, \qquad \text{distancia}(\mathbf{u},\mathbf{v}) = \lVert \mathbf{u} - \mathbf{v}\rVert.

Cauchy–Schwarz y el ángulo

Para que el coseno de un ángulo caiga en [1,1][-1, 1] hace falta una desigualdad —la Cauchy–Schwarz, una de las más importantes de la matemática:

u,vuv.\lvert \langle \mathbf{u}, \mathbf{v}\rangle\rvert \le \lVert \mathbf{u}\rVert\,\lVert \mathbf{v}\rVert.

Prueba (completando el cuadrado). Para todo escalar tt, la definición positiva da utv2=u22tu,v+t2v20\lVert \mathbf{u} - t\mathbf{v}\rVert^2 = \lVert \mathbf{u}\rVert^2 - 2t\langle \mathbf{u}, \mathbf{v}\rangle + t^2\lVert \mathbf{v}\rVert^2 \ge 0. Es una cuadrática en tt que nunca es negativa; su mínimo (en t=u,v/v2t^\star = \langle \mathbf{u},\mathbf{v}\rangle / \lVert \mathbf{v}\rVert^2) vale u2u,v2/v20\lVert \mathbf{u}\rVert^2 - \langle \mathbf{u},\mathbf{v}\rangle^2 / \lVert \mathbf{v}\rVert^2 \ge 0, que reordenado es la desigualdad.   \;\blacksquare (Ese tt^\star es, además, el coeficiente de proyección de abajo.)

Con eso, el cociente está garantizado en [1,1][-1,1] y define el ángulo:

cosθ=u,vuv.\cos\theta = \frac{\langle \mathbf{u}, \mathbf{v}\rangle}{\lVert \mathbf{u}\rVert\,\lVert \mathbf{v}\rVert}.

La revelación. Si el "producto interno" entre variables centradas es la covarianza X,Y=E[XY]\langle X, Y\rangle = \mathbb{E}[XY], entonces la longitud es la desviación estándar (X=E[X2]=σ\lVert X\rVert = \sqrt{\mathbb{E}[X^2]} = \sigma) y el coseno es la correlación ρ=Cov(X,Y)σXσY\rho = \tfrac{\operatorname{Cov}(X,Y)}{\sigma_X \sigma_Y}. Cauchy–Schwarz dice, en ese lenguaje, que ρ1\lvert\rho\rvert \le 1.

Ortogonalidad y proyección

El caso estrella es el ángulo de 90°90°: como cos90°=0\cos 90° = 0, dos vectores son ortogonales exactamente cuando u,v=0\langle \mathbf{u}, \mathbf{v}\rangle = 0 (en probabilidad: incorrelados). Y ahí vuelve Pitágoras: si uv\mathbf{u} \perp \mathbf{v}, u+v2=u2+v2\lVert \mathbf{u} + \mathbf{v}\rVert^2 = \lVert \mathbf{u}\rVert^2 + \lVert \mathbf{v}\rVert^2.

La proyección de u\mathbf{u} sobre la dirección de v\mathbf{v} —su mejor aproximación usando solo esa dirección— es

proyv(u)=u,vv2v,\operatorname{proy}_{\mathbf{v}}(\mathbf{u}) = \frac{\langle \mathbf{u}, \mathbf{v}\rangle}{\lVert \mathbf{v}\rVert^2}\,\mathbf{v},

y su propiedad definitoria es que el residual uproyv(u)\mathbf{u} - \operatorname{proy}_{\mathbf{v}}(\mathbf{u}) es ortogonal a v\mathbf{v}. Esa frase —"mejor aproximación, error perpendicular"— es, literalmente, mínimos cuadrados y esperanza condicional. Miralo:

Proyección: la sombra y el residual perpendicular — interactivo
vuproy
⟨u,v⟩ = 6.8   ‖u‖ = 2.95   ‖v‖ = 3.16
cos θ = ⟨u,v⟩/(‖u‖‖v‖) = 0.73   (θ ≈ 43.26°)
proy_v(u) = (⟨u,v⟩/‖v‖²)·v

La proyección de u sobre la dirección de v es su mejor aproximación usando solo esa dirección, y el residual (lo que sobra) es siempre perpendicular a v —ese ángulo recto es la firma—. Esa única idea —"mejor aproximación + error ortogonal"— es el germen de los mínimos cuadrados y de la esperanza condicional. El coseno del ángulo es, además, la correlación cuando el producto interno es la covarianza.

Bases ortonormales. Cuando los vectores de una base son perpendiculares y de longitud 11, hallar coordenadas es gratis: en vez de invertir una matriz (como en el cambio de base), las coordenadas son simples productos internos, v=iv,eiei\mathbf{v} = \sum_i \langle \mathbf{v}, \mathbf{e}_i\rangle\,\mathbf{e}_i.

Mínimos cuadrados: el punto más cercano

¿Qué hacés cuando Ax=bA\mathbf{x} = \mathbf{b} no tiene solución porque b\mathbf{b} sobresale del espacio columna (datos con ruido, más ecuaciones que incógnitas)? Te quedás con lo más cerca posible: proyectás b\mathbf{b} sobre el plano alcanzable. Y ese punto ortogonal es el más cercano —por Pitágoras:

Sea pS\mathbf{p} \in S con bpS\mathbf{b} - \mathbf{p} \perp S. Para cualquier otro sS\mathbf{s} \in S: bs2=bp2+ps2bp2\lVert \mathbf{b} - \mathbf{s}\rVert^2 = \lVert \mathbf{b} - \mathbf{p}\rVert^2 + \lVert \mathbf{p} - \mathbf{s}\rVert^2 \ge \lVert \mathbf{b} - \mathbf{p}\rVert^2, porque psS\mathbf{p} - \mathbf{s} \in S es ortogonal a bp\mathbf{b} - \mathbf{p}. La proyección minimiza la distancia.   \;\blacksquare

"Residual ortogonal a todo el subespacio" equivale a "ortogonal a cada columna", A(bAx^)=0A^\top(\mathbf{b} - A\hat{\mathbf{x}}) = \mathbf{0}, las ecuaciones normales:

AAx^=Abx^=(AA)1AbA^\top A\,\hat{\mathbf{x}} = A^\top\mathbf{b} \quad\Longrightarrow\quad \hat{\mathbf{x}} = (A^\top A)^{-1} A^\top\mathbf{b}

(cuando las columnas son independientes, así AAA^\top A es invertible). La matriz de proyección P=A(AA)1AP = A(A^\top A)^{-1}A^\top es idempotente (P2=PP^2 = P: proyectar lo ya proyectado no lo mueve) y simétrica.

OLS es esto, y el R² es un ángulo

Cambiá las etiquetas —AXA \to X (regresores), xβ\mathbf{x} \to \boldsymbol\beta, by\mathbf{b} \to \mathbf{y}— y aparece toda la regresión lineal:

β^=(XX)1Xy,y^=Xβ^=Hy,H=X(XX)1X.\hat{\boldsymbol\beta} = (X^\top X)^{-1} X^\top\mathbf{y}, \qquad \hat{\mathbf{y}} = X\hat{\boldsymbol\beta} = H\mathbf{y}, \qquad H = X(X^\top X)^{-1}X^\top.

HH es la matriz sombrero: el ajuste y^\hat{\mathbf{y}} es la proyección de las observaciones sobre el espacio columna, y las ecuaciones normales Xe=0X^\top\mathbf{e} = \mathbf{0} dicen, palabra por palabra, "los residuales no correlacionan con ningún predictor". Con datos centrados, Pitágoras da y2=y^2+e2\lVert \mathbf{y}\rVert^2 = \lVert \hat{\mathbf{y}}\rVert^2 + \lVert \mathbf{e}\rVert^2 (total = explicada + residual), y

R2=y^2y2=cos2θ,R^2 = \frac{\lVert \hat{\mathbf{y}}\rVert^2}{\lVert \mathbf{y}\rVert^2} = \cos^2\theta,

el coseno al cuadrado del ángulo entre y\mathbf{y} y el espacio columna. Movés la pendiente y mirás el SSE crecer fuera del óptimo:

Mínimos cuadrados: la recta que minimiza los residuales — interactivo
(x̄, ȳ)
pendiente m = 0.65
SSE(m) = 0.32
mínimo en m = β̂ = 0.64 → SSE = 0.32
R² = ‖ŷ‖²/‖y‖² = cos²θ = 0.98

estás en la recta de mínimos cuadrados: SSE es mínimo

La recta de mínimos cuadrados es la que hace mínima la suma de los residuales al cuadrado —proyectar las observaciones sobre lo que los regresores pueden alcanzar—. En el mínimo, los residuales son **perpendiculares** al regresor (las ecuaciones normales). Y el es cos²θ: qué tan alineadas están las observaciones con el espacio columna —1 si caen justo en la recta, 0 si son ortogonales—.

Multicolinealidad. Si las columnas de XX son dependientes, AAA^\top A es singular (ker(X){0}\ker(X) \neq \{\mathbf{0}\}): hay infinitos β^\hat{\boldsymbol\beta} con idéntico ajuste. La proyección y^\hat{\mathbf{y}} siempre existe y es única (es geometría); lo que no es único es la receta β^\hat{\boldsymbol\beta}. Ridge suma λI\lambda I para volver XX+λIX^\top X + \lambda I invertible y fijar una solución.

Matrices simétricas y definidas positivas

La proyección dejó a la vista una clase de matrices que reaparece sin parar: AAA^\top A. Siempre es simétrica ((AA)=AA(A^\top A)^\top = A^\top A) y semidefinida positiva, porque x(AA)x=Ax20\mathbf{x}^\top (A^\top A)\,\mathbf{x} = \lVert A\mathbf{x}\rVert^2 \ge 0. Es exactamente la forma de una matriz de covarianza.

Una forma cuadrática xMx\mathbf{x}^\top M\,\mathbf{x} con MM simétrica es definida positiva si xMx>0\mathbf{x}^\top M\,\mathbf{x} > 0 para todo x0\mathbf{x} \neq \mathbf{0} —el análogo de "a>0a > 0" en una parábola—, lo que equivale a que todos sus autovalores sean positivos. Esa positividad es lo que garantiza que una covarianza describa una nube real (un elipsoide con volumen) y que su factorización de Cholesky M=LLM = LL^\top exista, la forma estándar de "sacarle la raíz" a una matriz.

Lo que sigue

La frase "todos sus autovalores son positivos" abre la última puerta: autovalores, descomposición espectral, SVD y PCA —las direcciones propias de una matriz simétrica, y cómo diagonalizarla para volver círculos las elipses.