Probabilidad condicional e independencia
Sobre los cimientos de Kolmogorov, una sola idea mueve toda la inferencia: actualizar tu mundo cuando llega información. Antes pensabas que el espacio muestral era ; ahora sabés que ocurrió. Entonces es tu nuevo espacio muestral, y todo se renormaliza. De ahí salen Bayes, la independencia y —el concepto que hace funcionar todo filtro recursivo— la independencia condicional.
Probabilidad condicional
El problema concreto: tenés sobre y observás que ocurrió. ¿Cómo cambian tus probabilidades? No podés simplemente "ignorar" lo que pasa fuera de ; necesitás una nueva función que (i) viva sobre , (ii) preserve las proporciones relativas dentro de , y (iii) siga siendo una probabilidad legal. Hay una sola que cumple las tres:
Definición. Si y ,
Por qué esta fórmula y no otra: depende solo de la parte de que cae en (); da (dentro de , es seguro); y satisface los tres axiomas. Dividir por es la renormalización: si tenía masa , todo lo que está dentro se reescala por para que vuelva a sumar . Miralo encogerse:
A y B independientes
A (cobalto) y B (recuadro) se solapan en A ∩ B. Moviendo cuántas celdas de A caen dentro de B cambiás P(A|B) sin tocar P(A) = 0.30. La independencia es el filo donde P(A|B) = P(A); a un lado B favorece A, al otro lo desfavorece. Tocá «observar B».
Las cuatro consecuencias
1. Regla de multiplicación
Despejando la definición —y notando que :
Es el ladrillo de toda factorización secuencial. Aplicándola en cadena, cualquier conjunta se desarma en un producto de condicionales —la regla de la cadena:
2. Teorema de Bayes
Igualando las dos formas de y despejando se da vuelta el condicionamiento:
En lenguaje de inferencia, es la actualización posterior verosimilitud prior:
Lo más antiintuitivo de Bayes es el peso del prior. Con un test buenísimo pero una prevalencia baja, el posterior puede quedar sorprendentemente lejos del 100%: los pocos verdaderos positivos se ahogan entre los falsos positivos de una población sana enorme. Jugá con las tasas y mirá las frecuencias naturales:
Aunque el test sea muy bueno, con una prevalencia baja los pocos enfermos se ahogan entre los falsos positivos de una población sana enorme: el posterior queda lejos del 100%. Eso es el base-rate neglect, y es exactamente posterior ∝ verosimilitud × prior. El mismo cómputo es el paso de actualización de un filtro bayesiano.
3. Ley de probabilidad total
Si es una partición de , cualquier evento se reconstruye sumando sobre las "rebanadas":
Derivación. , y los son disjuntos porque los lo son. Por σ-aditividad, , y cada término es por la regla de multiplicación.
Su versión continua, marginalizando sobre un parámetro , es la evidencia —el denominador de Bayes—:
4. Independencia
y son independientes cuando saber uno no cambia el otro:
Cuidado con una confusión clásica: independiente no es lo mismo que disjunto —son casi opuestos. Si y son disjuntos y ambos tienen probabilidad positiva, entonces saber que ocurrió vuelve imposible a (): son fuertemente dependientes. La independencia es el filo exacto del interactivo de arriba, donde .
Independencia condicional
Acá está el concepto que casi nunca se enseña con la importancia que tiene. y son condicionalmente independientes dado si
En palabras: una vez que sé , saber no agrega información sobre . "tapa" o screens off a . Y esa es, literalmente, la arquitectura de los modelos de espacio de estados que usa medio mundo:
| Estructura | Independencia condicional |
|---|---|
| Cadena de Markov | |
| HMM (observación) | |
| Filtro de Kalman | |
| Naive Bayes |
El estado presente resume toda la historia: dado , el futuro no depende del pasado. Tocá el condicionamiento y mirá el screening-off:
El estado latente evoluciona como una cadena (xₜ₋₁ → xₜ → xₜ₊₁) y cada observación cuelga solo de su estado (xₜ → yₜ). Nada conecta las y entre sí directamente. Tocá «condicionar en xₜ» para ver el screening-off.
Sin independencia condicional no hay forward algorithm. La factorización
es una afirmación de independencia condicional, y es la que reduce un cómputo —sumar sobre todas las trayectorias de estados— a . Ese es el ahorro combinatorio que hace viable el filtrado.
Información, medibilidad y look-ahead bias
Condicionar es, en el fondo, elegir qué información tenés disponible —y eso es una σ-álgebra. En una serie temporal, la filtración es la información hasta el instante , y una variable es -medible si para todo : "se puede calcular con lo conocido hasta ". Eso decide qué es legal usar en cada momento:
| Variable | ¿-medible? | Por qué |
|---|---|---|
| Dato observado hasta | sí | ya está en el historial |
| Función solo del pasado y el presente | sí | computable con |
| Valor futuro | no | aún no ocurrió |
| Estadístico de toda la muestra (incluye el futuro) | no | usa datos posteriores a |
Usar una variable que no es -medible —que depende del futuro— es el look-ahead bias: decidir en con información que recién existe después. El caso clásico es normalizar una serie con su media y desvío globales antes de evaluar una regla en el tiempo: cada punto queda contaminado con el futuro. Y cuando una cantidad de interés no es observable en pero sí lo es un proceso relacionado, la mejor aproximación -medible es la esperanza condicional —estimarla recursivamente es, precisamente, filtrar.
Lo que sigue
Con condicionamiento e independencia en la mano, la inferencia ya tiene su gramática completa: vs , priors y posteriors, y la independencia que sostiene tanto el filtrado como la hipótesis iid de los teoremas límite. El próximo paso es ponerla a estimar: estimadores y sus propiedades —sesgo, varianza, consistencia— y la máxima verosimilitud.