OpenBetaMatemática

← Temas

Completar el cuadrado

Es una sola idea —reescribir un cuadrático como un cuadrado perfecto más una constante— pero rinde por tres: revela el vértice de una parábola, demuestra la fórmula cuadrática, y deja leer la media y la varianza dentro de un exponente gaussiano sin integrar nada. Después se generaliza a vectores y se vuelve la columna vertebral de los modelos gaussianos.

Caso escalar

Coeficiente líder igual a 1

El núcleo es geométrico: x2+bxx^2 + bx son un cuadrado x2x^2 más dos franjas; para cerrar el cuadrado grande de lado x+b2x + \tfrac{b}{2} falta la esquina (b2)2\bigl(\tfrac{b}{2}\bigr)^2.

x2+bx+c=(x+b2)2+(cb24).x^2 + bx + c = \left(x + \frac{b}{2}\right)^2 + \left(c - \frac{b^2}{4}\right).
Completar el cuadrado, literalmente — interactivo
1x1x1x + 1
x² + 2x
= (x + 1)² − 1

las dos franjas suman bx; para cerrar el cuadrado grande falta la esquina (b/2)², así que la sumás y la restás.

bx son dos rectángulos (b/2)·x pegados a un cuadrado . Juntos casi forman el cuadrado grande de lado x + b/2 —solo falta la esquinita (b/2)². Esa es toda la idea: x² + bx = (x + b/2)² − (b/2)². Con líder a ≠ 1, primero sacás a como factor común y completás adentro.

El paréntesis es el vértice: la parábola y=x2+bx+cy = x^2 + bx + c tiene su mínimo en x=b2x = -\tfrac{b}{2}, con valor cb24c - \tfrac{b^2}{4}.

Coeficiente líder distinto de 1

Con a1a \neq 1 se saca aa como factor común de los dos primeros términos y se completa adentro:

ax2+bx+c=a(x+b2a)2+(cb24a).ax^2 + bx + c = a\left(x + \frac{b}{2a}\right)^2 + \left(c - \frac{b^2}{4a}\right).

De acá sale todo. El vértice es (b2a,  cb24a)\left(-\tfrac{b}{2a},\; c - \tfrac{b^2}{4a}\right). Y poniendo ax2+bx+c=0ax^2 + bx + c = 0 y despejando se obtiene, sin trucos, la fórmula cuadrática:

(x+b2a)2=b24ac4a2    x=b±b24ac2a.\left(x + \frac{b}{2a}\right)^2 = \frac{b^2 - 4ac}{4a^2} \;\Longrightarrow\; x = \frac{-b \pm \sqrt{b^2 - 4ac}}{2a}.

La fórmula no es algo para memorizar: es completar el cuadrado, ejecutado una vez en general.

Leer media y varianza desde un exponente gaussiano

Acá está el pago estadístico. Una densidad gaussiana es e(xμ)22σ2\propto e^{-\frac{(x-\mu)^2}{2\sigma^2}}, así que cualquier exp\exp de un cuadrático en xx es una gaussiana disfrazada. Completando el cuadrado en el exponente,

12ax2+bx  =  12σ2(xμ)2+cte,  μ=ba,σ2=1a  -\tfrac{1}{2}a\,x^2 + b\,x \;=\; -\frac{1}{2\sigma^2}(x - \mu)^2 + \text{cte}, \qquad \boxed{\;\mu = \frac{b}{a}, \quad \sigma^2 = \frac{1}{a}\;}

donde aa es la precisión (inverso de la varianza). Moviendo aa y bb se ve cómo el exponente fija el centro y el ancho:

Leer μ y σ² desde el exponente — interactivo-6-4-20246μ = 1μ+σ
exp(−½·1·x² + 1·x) ∝ exp(−(x − μ)² / 2σ²)
μ = b/a = 1 · σ² = 1/a = 1  ·  σ = 1

Un exponente cuadrático −½a·x² + b·x es, completando el cuadrado, una gaussiana disfrazada. Al completarlo aparecen μ = b/a (la media, donde está el pico) y σ² = 1/a (la varianza). Subí a y la campana se angosta (más precisión); movés b y se desplaza. Esto es lo que se hace para identificar el posterior gaussiano en una actualización bayesiana, sin integrar nada.

Posterior Gaussiano-Gaussiano

Cuando multiplicás un prior gaussiano por una verosimilitud gaussiana, el producto vuelve a ser exp\exp de un cuadrático: completás el cuadrado, leés μ\mu y σ2\sigma^2 del posterior, y listo —sin resolver ninguna integral—. Con prior xN(μ0,σ02)x \sim N(\mu_0, \sigma_0^2) y dato yxN(x,σ2)y \mid x \sim N(x, \sigma^2), sumás los exponentes y juntás los términos en xx:

logp(xy)=12(1σ02+1σ2)ax2+(μ0σ02+yσ2)bx+cte.\log p(x \mid y) = -\tfrac12 \underbrace{\Bigl(\tfrac{1}{\sigma_0^2} + \tfrac{1}{\sigma^2}\Bigr)}_{a}\, x^2 + \underbrace{\Bigl(\tfrac{\mu_0}{\sigma_0^2} + \tfrac{y}{\sigma^2}\Bigr)}_{b}\, x + \text{cte}.

Aplicando el diccionario μ=b/a\mu = b/a, σ2=1/a\sigma^2 = 1/a:

  1σpost2=1σ02+1σ2,μpost=μ0σ02+yσ21σ02+1σ2  \boxed{\;\frac{1}{\sigma_{\text{post}}^2} = \frac{1}{\sigma_0^2} + \frac{1}{\sigma^2}, \qquad \mu_{\text{post}} = \frac{\tfrac{\mu_0}{\sigma_0^2} + \tfrac{y}{\sigma^2}}{\tfrac{1}{\sigma_0^2} + \tfrac{1}{\sigma^2}}\;}

Dos lecturas que valen oro: las precisiones se suman (la información se acumula, y el posterior es más angosto que el prior y que el dato) y la media posterior es un promedio ponderado por precisión de ambos. Todo salió de completar el cuadrado y leer el diccionario —nada más—. Es, además, exactamente Ridge = MAP y el corazón escalar del filtrado gaussiano.

Caso matricial

Formas cuadráticas vectoriales

En varias variables, x2x^2 se generaliza a una forma cuadrática xAx\mathbf{x}^\top A\, \mathbf{x} con AA simétrica. Si AA es definida positiva, es el análogo de "a>0a > 0": un tazón convexo con un único mínimo.

Por qué la covarianza debe ser definida positiva. En la normal multivariante, la matriz del exponente es A=Σ1A = \Sigma^{-1} (la precisión). Que sea definida positiva es lo que garantiza que 12(xμ)Σ1(xμ)-\tfrac12(\mathbf{x}-\boldsymbol\mu)^\top\Sigma^{-1}(\mathbf{x}-\boldsymbol\mu) sea negativo fuera del centro —que la densidad tenga un pico real y decaiga en todas las direcciones—. Una Σ\Sigma no definida positiva no describe una gaussiana válida.

Expansión de (xμ)Σ1(xμ)(\mathbf{x}-\boldsymbol\mu)^\top \Sigma^{-1} (\mathbf{x}-\boldsymbol\mu)

El exponente de la gaussiana multivariada se expande igual que (xμ)2(x-\mu)^2, cuidando que Σ1\Sigma^{-1} es simétrica (los dos términos cruzados se combinan en uno con factor 22):

(xμ)Σ1(xμ)=xΣ1xcuadraˊtico    2μΣ1xlineal  +  μΣ1μconstante.(\mathbf{x}-\boldsymbol\mu)^\top \Sigma^{-1} (\mathbf{x}-\boldsymbol\mu) = \underbrace{\mathbf{x}^\top \Sigma^{-1}\mathbf{x}}_{\text{cuadrático}} \;-\; \underbrace{2\,\boldsymbol\mu^\top \Sigma^{-1}\mathbf{x}}_{\text{lineal}} \;+\; \underbrace{\boldsymbol\mu^\top \Sigma^{-1}\boldsymbol\mu}_{\text{constante}}.

Las curvas de nivel de esta forma —la distancia de Mahalanobis al cuadrado— son elipses, con ejes dados por los autovectores de Σ\Sigma y semiejes λ\sqrt{\lambda}:

Forma cuadrática (x−μ)ᵀΣ⁻¹(x−μ): elipses — interactivo
μ
Σ = [ 2.56   0.96 ;   0.96   1 ]
autovalores λ = 3.02, 0.54
semiejes (1σ) = 1.74, 0.74

La forma cuadrática (x−μ)ᵀΣ⁻¹(x−μ) es la distancia de Mahalanobis al cuadrado, y sus curvas de nivel son elipses. Las direcciones de los ejes (en rojo) son los autovectores de Σ y los semiejes valen √λ: la correlación ρ inclina la elipse y los σ la estiran. Completar el cuadrado en dimensión n es, exactamente, diagonalizar esta forma para desacoplar las variables.

Completar el cuadrado en dimensión nn

El proceso es idéntico al escalar, con A1A^{-1} donde antes había 1a\tfrac{1}{a}. Dado un cuadrático con término lineal,

xAx2bx=(xA1b)A(xA1b)bA1b.\mathbf{x}^\top A\, \mathbf{x} - 2\,\mathbf{b}^\top \mathbf{x} = (\mathbf{x} - A^{-1}\mathbf{b})^\top A\,(\mathbf{x} - A^{-1}\mathbf{b}) - \mathbf{b}^\top A^{-1}\mathbf{b}.

El "vértice" es x=A1b\mathbf{x}^\star = A^{-1}\mathbf{b}. Llevado al exponente gaussiano 12xAx+bx-\tfrac12 \mathbf{x}^\top A\,\mathbf{x} + \mathbf{b}^\top\mathbf{x}, esto dice que la media es μ=A1b\boldsymbol\mu = A^{-1}\mathbf{b} y la covarianza es Σ=A1\Sigma = A^{-1} (con AA la matriz de precisión). Es la versión vectorial de μ=b/a\mu = b/a, σ2=1/a\sigma^2 = 1/a.

Esta única identidad resuelve, completando el cuadrado, la media de un posterior gaussiano multivariado, la solución de mínimos cuadrados (ordinarios, generalizados, ridge) y el paso de actualización de los filtros gaussianos —todos son el mismo cuadrático, minimizado. Diagonalizar AA (rotar a sus autovectores) desacopla las variables: es lo que las elipses inclinadas vuelven círculos.

La traducción escalar → matricial, en una línea: donde el escalar divide por aa, el matricial multiplica por A1A^{-1}. Centro baA1b\tfrac{b}{a} \to A^{-1}\mathbf{b}; varianza 1aΣ=A1\tfrac{1}{a} \to \Sigma = A^{-1}. Esa única regla convierte cada resultado gaussiano escalar en su versión multivariante.

Recall activo

Resolvé sin mirar:

  1. Completá x210x+7x^2 - 10x + 7.
  2. Completá 2x2+8x+32x^2 + 8x + 3.
  3. Un exponente vale 12(4x212x)+cte-\tfrac12(4x^2 - 12x) + \text{cte}. ¿Cuál es μ\mu y cuál σ2\sigma^2?
  4. En el posterior Gaussiano-Gaussiano con σ02=σ2=1\sigma_0^2 = \sigma^2 = 1, ¿cuánto vale σpost2\sigma_{\text{post}}^2? ¿Tiene sentido que sea menor que 11?
  5. ¿Cuál es el "centro" de xAx2bx\mathbf{x}^\top A\mathbf{x} - 2\mathbf{b}^\top\mathbf{x}?

Soluciones: (1) (x5)218(x-5)^2 - 18; (2) 2(x+2)252(x+2)^2 - 5; (3) a=4a=4, b=6b=6μ=3/2\mu = 3/2, σ2=1/4\sigma^2 = 1/4; (4) precisiones 1+1=21+1=2, luego σpost2=1/2\sigma_{\text{post}}^2 = 1/2 —sí, dos fuentes dan más certeza que una; (5) A1bA^{-1}\mathbf{b}.

Lo que sigue

Completar el cuadrado conecta álgebra con probabilidad. La Parte III suma las otras dos herramientas que aparecen en cuanto hay verosimilitudes y productos: exponenciales y logaritmos —que convierten productos en sumas— y las sumatorias y series.