Exponenciales y logaritmos
Exponencial y logaritmo son funciones inversas, y entre las dos hacen un solo truco que vale oro: la exponencial convierte sumas en productos () y el logaritmo convierte productos en sumas (). Ese cambio de operación es la razón por la que aparecen en todos lados.
Leyes de los exponentes
Todas salen de una: es multiplicar por sí mismo veces, así que sumar exponentes es concatenar productos.
Las definiciones "raras" no son convenciones arbitrarias: se eligen para que la ley siga valiendo. Por eso (para que ), , y .
Propiedades del logaritmo
es la inversa de : . Cada ley de exponentes se refleja en una ley de logaritmos (definidas solo para argumento ):
De dónde sale la estrella. Escribí , (o sea , ). Entonces , así que . La propiedad producto→suma del log es, literalmente, la ley leída a través de la inversa.
La primera es la estrella, y se ve mejor que se lee: en una escala logarítmica, multiplicar es sumar distancias.
En una escala logarítmica, multiplicar es sumar distancias: la posición de ab es exactamente la de a más la de b. Esa es la razón de fondo por la que se maximiza la log-verosimilitud: un producto de densidades ∏ pᵢ se vuelve una suma Σ log pᵢ —más fácil de derivar y, sobre todo, sin underflow (mil factores de 0.01 dan 10⁻²⁰⁰⁰, que es cero en coma flotante; su suma de logaritmos, en cambio, es un número común).
De productos a sumas: la log-verosimilitud
Acá está el uso que justifica todo. Cuando datos son independientes, su verosimilitud es un producto,
y maximizar esto a mano es horrible: derivar un producto de factores con la regla del producto es inviable. El logaritmo lo arregla. Como es estrictamente creciente, maximizar y maximizar dan el mismo ; pero el log convierte el producto en suma:
Ahora derivar es sumar derivadas, (la score), y resolver es tratable. Hay además una razón numérica brutal: un producto de muchas probabilidades desaparece por underflow —mil factores de dan , que en coma flotante es exactamente —, mientras que su suma de logaritmos es un número perfectamente representable. Siempre se trabaja en log.
Log-sum-exp
El compañero inevitable: cuando hay que normalizar (softmax, la evidencia de un modelo, la función de partición) aparece
Calcularlo ingenuamente vuelve a romper: si algún es grande, desborda a infinito. El arreglo es factorizar el máximo :
Ahora todos los exponentes son , así que ningún término pasa de —nada desborda— y el resultado es idéntico. Probalo subiendo un por encima de :
LSE(x) = log Σ eˣⁱ aparece en cada normalización (softmax, evidencia, partición). El problema: con xᵢ grandes, e^xᵢ desborda a infinito (arriba de ~709 en float64) y el cálculo ingenuo muere. El truco: factorizar el máximo m, LSE = m + log Σ e^(xᵢ−m) —todos los exponentes quedan ≤ 0, nada desborda, y el resultado es idéntico. Subí un xᵢ por encima de 709 y mirá morir al ingenuo. Además, LSE es un máximo suave: queda entre max y max + log n, y los pesos softmax son justo los e^(xᵢ−m) renormalizados.
Dos lecturas extra: LSE es un máximo suave —siempre entre y —, y su gradiente es exactamente el softmax , los pesos que ves en el gráfico.
Recall activo
Resolvé sin mirar:
- Simplificá .
- Escribí como suma.
- Estabilizá con LSE (sin calcular ).
- ¿Por qué ? (la razón, no solo el valor)
Soluciones: (1) ; (2) ; (3) , da ; (4) para que siga valiendo, debe ser el neutro .
Lo que sigue
La log-verosimilitud nos dejó sumas por todos lados. La próxima lección las toma en serio: sumatorias y series —manipular índices, telescoping, la serie geométrica y el teorema del binomio.