OpenBetaMatemática

← Temas

Probabilidad condicional e independencia

Sobre los cimientos de Kolmogorov, una sola idea mueve toda la inferencia: actualizar tu mundo cuando llega información. Antes pensabas que el espacio muestral era Ω\Omega; ahora sabés que BB ocurrió. Entonces BB es tu nuevo espacio muestral, y todo se renormaliza. De ahí salen Bayes, la independencia y —el concepto que hace funcionar todo filtro recursivo— la independencia condicional.

Probabilidad condicional

El problema concreto: tenés PP sobre (Ω,F)(\Omega, \mathcal F) y observás que BB ocurrió. ¿Cómo cambian tus probabilidades? No podés simplemente "ignorar" lo que pasa fuera de BB; necesitás una nueva función que (i) viva sobre BB, (ii) preserve las proporciones relativas dentro de BB, y (iii) siga siendo una probabilidad legal. Hay una sola que cumple las tres:

Definición. Si A,BFA, B \in \mathcal F y P(B)>0P(B) > 0, P(AB)=P(AB)P(B).P(A \mid B) = \frac{P(A \cap B)}{P(B)}.

Por qué esta fórmula y no otra: depende solo de la parte de AA que cae en BB (ABA\cap B); da P(BB)=1P(B\mid B) = 1 (dentro de BB, BB es seguro); y AP(AB)A \mapsto P(A\mid B) satisface los tres axiomas. Dividir por P(B)P(B) es la renormalización: si BB tenía masa 0.40.4, todo lo que está dentro se reescala por 1/0.41/0.4 para que vuelva a sumar 11. Miralo encogerse:

Condicionar = renormalizar — interactivo
B
P(A)0.30P(B)0.40P(A ∩ B)0.12P(A | B)0.30
P(A|B) = P(A∩B) / P(B) = 0.12 / 0.40 = 0.30

A y B independientes

A (cobalto) y B (recuadro) se solapan en A ∩ B. Moviendo cuántas celdas de A caen dentro de B cambiás P(A|B) sin tocar P(A) = 0.30. La independencia es el filo donde P(A|B) = P(A); a un lado B favorece A, al otro lo desfavorece. Tocá «observar B».

Las cuatro consecuencias

1. Regla de multiplicación

Despejando la definición —y notando que AB=BAA\cap B = B\cap A:

P(AB)=P(AB)P(B)=P(BA)P(A).P(A \cap B) = P(A \mid B)\, P(B) = P(B \mid A)\, P(A).

Es el ladrillo de toda factorización secuencial. Aplicándola en cadena, cualquier conjunta se desarma en un producto de condicionales —la regla de la cadena:

P(A1A2An)=P(A1)P(A2A1)P(A3A1,A2)P(AnA1,,An1).P(A_1 \cap A_2 \cap \dots \cap A_n) = P(A_1)\, P(A_2 \mid A_1)\, P(A_3 \mid A_1, A_2) \cdots P(A_n \mid A_1, \dots, A_{n-1}).

2. Teorema de Bayes

Igualando las dos formas de P(AB)P(A\cap B) y despejando se da vuelta el condicionamiento:

P(AB)=P(BA)P(A)P(B).P(A \mid B) = \frac{P(B \mid A)\, P(A)}{P(B)}.

En lenguaje de inferencia, es la actualización posterior \propto verosimilitud ×\times prior:

p(xy)posterior=p(yx)verosimilitud  p(x)priorp(y)evidencia.\underbrace{p(x \mid y)}_{\text{posterior}} = \frac{\overbrace{p(y \mid x)}^{\text{verosimilitud}}\; \overbrace{p(x)}^{\text{prior}}}{\underbrace{p(y)}_{\text{evidencia}}}.

Lo más antiintuitivo de Bayes es el peso del prior. Con un test buenísimo pero una prevalencia baja, el posterior puede quedar sorprendentemente lejos del 100%: los pocos verdaderos positivos se ahogan entre los falsos positivos de una población sana enorme. Jugá con las tasas y mirá las frecuencias naturales:

Bayes por frecuencias naturales — interactivo
P(enfermo | test +)
15.5%
de cada 100: 2 enfermos+ y 10 sanos+ dan positivo
los que dan positivo:
verdaderos +falsos +

Aunque el test sea muy bueno, con una prevalencia baja los pocos enfermos se ahogan entre los falsos positivos de una población sana enorme: el posterior queda lejos del 100%. Eso es el base-rate neglect, y es exactamente posterior ∝ verosimilitud × prior. El mismo cómputo es el paso de actualización de un filtro bayesiano.

3. Ley de probabilidad total

Si {B1,B2,}\{B_1, B_2, \dots\} es una partición de Ω\Omega, cualquier evento AA se reconstruye sumando sobre las "rebanadas":

P(A)=i=1P(ABi)P(Bi).P(A) = \sum_{i=1}^\infty P(A \mid B_i)\, P(B_i).

Derivación. A=AΩ=i(ABi)A = A \cap \Omega = \bigcup_i (A \cap B_i), y los ABiA\cap B_i son disjuntos porque los BiB_i lo son. Por σ-aditividad, P(A)=iP(ABi)P(A) = \sum_i P(A\cap B_i), y cada término es P(ABi)P(Bi)P(A\mid B_i)P(B_i) por la regla de multiplicación.   \;\blacksquare

Su versión continua, marginalizando sobre un parámetro θ\theta, es la evidencia p(y)p(y) —el denominador de Bayes—:

p(y)=p(yθ)p(θ)dθ.p(y) = \int p(y \mid \theta)\, p(\theta)\, d\theta.

4. Independencia

AA y BB son independientes cuando saber uno no cambia el otro:

P(AB)=P(A)P(B)    P(AB)=P(A).P(A \cap B) = P(A)\, P(B) \iff P(A \mid B) = P(A).

Cuidado con una confusión clásica: independiente no es lo mismo que disjunto —son casi opuestos. Si AA y BB son disjuntos y ambos tienen probabilidad positiva, entonces saber que ocurrió BB vuelve imposible a AA (P(AB)=0P(A)P(A\mid B) = 0 \neq P(A)): son fuertemente dependientes. La independencia es el filo exacto del interactivo de arriba, donde P(AB)=P(A)P(A\mid B) = P(A).

Independencia condicional

Acá está el concepto que casi nunca se enseña con la importancia que tiene. AA y BB son condicionalmente independientes dado CC si

P(ABC)=P(AC)P(BC),equivalente aP(AB,C)=P(AC).P(A \cap B \mid C) = P(A \mid C)\, P(B \mid C), \qquad\text{equivalente a}\qquad P(A \mid B, C) = P(A \mid C).

En palabras: una vez que sé CC, saber BB no agrega información sobre AA. CC "tapa" o screens off a BB. Y esa es, literalmente, la arquitectura de los modelos de espacio de estados que usa medio mundo:

EstructuraIndependencia condicional
Cadena de Markovxt+1xt1,,x0xtx_{t+1} \perp x_{t-1}, \dots, x_0 \mid x_t
HMM (observación)yty1:t1,x1:t1xty_t \perp y_{1:t-1},\, x_{1:t-1} \mid x_t
Filtro de Kalmanxt+1y1:t1xtx_{t+1} \perp y_{1:t-1} \mid x_t
Naive Bayesyiyjclasey_i \perp y_j \mid \text{clase}

El estado presente resume toda la historia: dado xtx_t, el futuro no depende del pasado. Tocá el condicionamiento y mirá el screening-off:

La estructura del HMM — interactivo
xₜ₋₁xₜxₜ₊₁yₜ₋₁yₜyₜ₊₁estadoobs.

El estado latente evoluciona como una cadena (xₜ₋₁ → xₜ → xₜ₊₁) y cada observación cuelga solo de su estado (xₜ → yₜ). Nada conecta las y entre sí directamente. Tocá «condicionar en xₜ» para ver el screening-off.

Sin independencia condicional no hay forward algorithm. La factorización

p(y1:Tx1:T)=t=1Tp(ytxt)p(y_{1:T} \mid x_{1:T}) = \prod_{t=1}^{T} p(y_t \mid x_t)

es una afirmación de independencia condicional, y es la que reduce un cómputo O(NT)O(N^T) —sumar sobre todas las trayectorias de estados— a O(NT)O(NT). Ese es el ahorro combinatorio que hace viable el filtrado.

Información, medibilidad y look-ahead bias

Condicionar es, en el fondo, elegir qué información tenés disponible —y eso es una σ-álgebra. En una serie temporal, la filtración {Ft}\{\mathcal F_t\} es la información hasta el instante tt, y una variable ZZ es Ft\mathcal F_t-medible si {Zc}Ft\{Z \le c\} \in \mathcal F_t para todo cc: "se puede calcular con lo conocido hasta tt". Eso decide qué es legal usar en cada momento:

Variable¿Ft\mathcal F_t-medible?Por qué
Dato observado hasta ttya está en el historial
Función solo del pasado y el presentecomputable con Ft\mathcal F_t
Valor futuro Xt+1X_{t+1}noaún no ocurrió
Estadístico de toda la muestra (incluye el futuro)nousa datos posteriores a tt

Usar una variable que no es Ft\mathcal F_t-medible —que depende del futuro— es el look-ahead bias: decidir en tt con información que recién existe después. El caso clásico es normalizar una serie con su media y desvío globales antes de evaluar una regla en el tiempo: cada punto queda contaminado con el futuro. Y cuando una cantidad de interés no es observable en tt pero sí lo es un proceso relacionado, la mejor aproximación Ft\mathcal F_t-medible es la esperanza condicional E[Ft]E[\,\cdot \mid \mathcal F_t] —estimarla recursivamente es, precisamente, filtrar.

Lo que sigue

Con condicionamiento e independencia en la mano, la inferencia ya tiene su gramática completa: P\mathbb P vs Q\mathbb Q, priors y posteriors, y la independencia que sostiene tanto el filtrado como la hipótesis iid de los teoremas límite. El próximo paso es ponerla a estimar: estimadores y sus propiedades —sesgo, varianza, consistencia— y la máxima verosimilitud.