OpenBetaMatemática

← Temas

Apéndice B — Teoría de la medida para probabilistas

La integral de Lebesgue dio la versión mínima. Acá están los cuatro teoremas que la probabilidad moderna usa todo el tiempo: Fubini–Tonelli justifica intercambiar el orden de integración (esperanzas iteradas); Borel–Cantelli es la herramienta del "casi seguramente"; Radon–Nikodym formaliza la densidad y el cambio de medida; y las martingalas son el lenguaje del filtrado y de la ausencia de look-ahead.

1. Fubini y Tonelli

¿Se puede calcular una integral doble integrando primero en una variable y luego en la otra, en cualquier orden? Casi siempre —pero "casi" esconde una trampa.

Tonelli (no negativas). Si (X,μ)(X,\mu), (Y,ν)(Y,\nu) son σ\sigma-finitos y f0f \ge 0 es medible, las tres integrales coinciden: fd(μ×ν)=X ⁣(Yfdν)dμ=Y ⁣(Xfdμ)dν.\iint f\,d(\mu\times\nu) = \int_X\!\Bigl(\int_Y f\,d\nu\Bigr)d\mu = \int_Y\!\Bigl(\int_X f\,d\mu\Bigr)d\nu. Para integrandos 0\ge 0 el orden nunca importa (aunque el valor sea ++\infty).

Fubini (integrables). Si fd(μ×ν)<\iint \lvert f\rvert\,d(\mu\times\nu) < \infty, las integrales iteradas existen, son finitas y coinciden con la doble, en cualquier orden.

Estrategia. Aplicá Tonelli a f\lvert f\rvert para verificar la integrabilidad; una vez que f<\iint\lvert f\rvert < \infty, descomponé f=f+ff = f^+ - f^-, aplicá Tonelli a cada parte (0\ge 0 y finitas) y restá.   \;\blacksquare

Sin integrabilidad, falla. Para f(x,y)=x2y2(x2+y2)2f(x,y) = \tfrac{x^2 - y^2}{(x^2+y^2)^2} en [0,1]2[0,1]^2, un orden da π4-\tfrac\pi4 y el otro +π4+\tfrac\pi4. No contradice Fubini porque f=\iint\lvert f\rvert = \infty: la hipótesis de integrabilidad es justo lo que protege.

En probabilidad es lo que justifica la ley de esperanzas iteradas y todo intercambio de \sum con E\mathbb{E}: E[nXn]=nE[Xn]\mathbb{E}[\sum_n X_n] = \sum_n \mathbb{E}[X_n] es Tonelli (si Xn0X_n \ge 0) o Fubini (si EXn<\sum \mathbb{E}\lvert X_n\rvert < \infty).

2. Los lemas de Borel–Cantelli

El evento "infinitas veces". Dada A1,A2,A_1, A_2, \dots, el evento {An i.o.}\{A_n \text{ i.o.}\} es lim supnAn=NnNAn\limsup_n A_n = \bigcap_N \bigcup_{n \ge N} A_n: los resultados que están en AnA_n para infinitos nn.

BC1. Si nP(An)<\sum_n \mathbb{P}(A_n) < \infty, entonces P(An i.o.)=0\mathbb{P}(A_n \text{ i.o.}) = 0: casi seguramente solo ocurren finitos. (No requiere independencia.)

Prueba. {An i.o.}nNAn\{A_n \text{ i.o.}\} \subseteq \bigcup_{n \ge N} A_n, así que por subaditividad P(An i.o.)nNP(An)0\mathbb{P}(A_n \text{ i.o.}) \le \sum_{n \ge N} \mathbb{P}(A_n) \to 0.   \;\blacksquare

BC2. Si los AnA_n son independientes y nP(An)=\sum_n \mathbb{P}(A_n) = \infty, entonces P(An i.o.)=1\mathbb{P}(A_n \text{ i.o.}) = 1: casi seguramente ocurren infinitos.

Prueba. Basta que nNAnc\bigcap_{n \ge N} A_n^c tenga probabilidad 00. Por independencia y 1xex1 - x \le e^{-x}: n=NM(1P(An))exp(n=NMP(An))0\prod_{n=N}^M (1 - \mathbb{P}(A_n)) \le \exp(-\sum_{n=N}^M \mathbb{P}(A_n)) \to 0.   \;\blacksquare

La dicotomía. Para eventos independientes, P(An)\sum \mathbb{P}(A_n) converge (i.o. tiene prob. 00) o diverge (prob. 11) —nunca un valor intermedio—. Es un caso de la ley 0–1 de Kolmogorov.

Es la herramienta central de la convergencia casi segura —el modo detrás de la ley fuerte de los grandes números y la consistencia fuerte—: para probar θ^nθ\hat\theta_n \to \theta c.s. se acota nP(θ^nθ>ε)<\sum_n \mathbb{P}(\lvert \hat\theta_n - \theta\rvert > \varepsilon) < \infty y se aplica BC1. Es el puente entre cotas de probabilidad (Markov, Chebyshev) y convergencia c.s.

3. El teorema de Radon–Nikodym

¿Qué es, rigurosamente, una densidad? ¿Y cuándo una medida se escribe como "densidad por otra medida"? La condición exacta es la continuidad absoluta.

Continuidad absoluta. νμ\nu \ll \mu ("ν\nu es absolutamente continua respecto de μ\mu") si μ(A)=0ν(A)=0\mu(A) = 0 \Rightarrow \nu(A) = 0: ν\nu "vive donde vive μ\mu".

Teorema (Radon–Nikodym). Si μ,ν\mu, \nu son σ\sigma-finitas y νμ\nu \ll \mu, existe una f0f \ge 0 medible, única salvo conjuntos μ\mu-nulos, con ν(A)=Afdμ\nu(A) = \int_A f\,d\mu para todo AA. Esa f=dνdμf = \tfrac{d\nu}{d\mu} es la derivada de Radon–Nikodym —la definición rigurosa de densidad—.

Idea (von Neumann, vía L2L^2). Con μ,ν\mu, \nu finitas y ρ=μ+ν\rho = \mu + \nu, el funcional T(g)=gdνT(g) = \int g\,d\nu sobre L2(ρ)L^2(\rho) es acotado, así que por representación de Riesz hay hL2(ρ)h \in L^2(\rho) con gdν=ghdρ\int g\,d\nu = \int gh\,d\rho. Reordenando dρ=dμ+dνd\rho = d\mu + d\nu y probando 0h<10 \le h < 1 c.s. (acá entra νμ\nu \ll \mu), la densidad es f=h1hf = \tfrac{h}{1-h}. La proyección ortogonal en L2L^2 —el mismo Hilbert del Cap. 11— es el corazón.   \;\blacksquare

La hipótesis νμ\nu \ll \mu es necesaria: si ν\nu pusiera masa donde μ\mu no ve nada (una masa puntual frente a Lebesgue), ninguna densidad podría reproducirla. En general, la descomposición de Lebesgue separa cualquier ν\nu en una parte con densidad y una parte singular.

Es el cimiento de la densidad p=dPdλp = \tfrac{d\mathbb{P}}{d\lambda} (por eso E[g(X)]=gpdx\mathbb{E}[g(X)] = \int g\,p\,dx), del cociente de verosimilitud dPθdPθ0\tfrac{d\mathbb{P}_\theta}{d\mathbb{P}_{\theta_0}} (tests, importance sampling), y del cambio de medida riesgo-neutral dQdP\tfrac{d\mathbb{Q}}{d\mathbb{P}} del pricing (y de Girsanov en tiempo continuo). Cada cambio de medida es una densidad de Radon–Nikodym.

4. Martingalas: convergencia y descomposición de Doob

Una martingala es un "juego justo": tu mejor predicción del valor futuro, dada toda la información de hoy, es el valor de hoy.

Definiciones. Una filtración {Fn}\{\mathcal{F}_n\} es una sucesión creciente de σ-álgebras (la información hasta nn). XnX_n es adaptado si cada XnX_n es Fn\mathcal{F}_n-medible (no usa el futuro). Es martingala si es integrable y E[Xn+1Fn]=Xn\mathbb{E}[X_{n+1} \mid \mathcal{F}_n] = X_n (con \le: supermartingala; \ge: submartingala).

La esperanza condicional es la proyección ortogonal del Cap. 11, y "adaptado" formaliza la ausencia de look-ahead: solo información presente y pasada.

Convergencia de martingalas (Doob). Si XnX_n es una (super)martingala acotada en L1L^1 (supnEXn<\sup_n \mathbb{E}\lvert X_n\rvert < \infty), entonces XnX_n converge casi seguramente a un XX_\infty integrable.

Idea. La desigualdad de cruces de Doob acota el número esperado de veces que la martingala cruza un intervalo [a,b][a,b] por EXn+aba\tfrac{\mathbb{E}\lvert X_n\rvert + \lvert a\rvert}{b-a}. Si no convergiera, oscilaría infinitas veces a través de algún [a,b][a,b] racional —pero los cruces esperados son finitos—. Contradicción.   \;\blacksquare

Descomposición de Doob. Todo proceso adaptado e integrable se escribe de forma única como Xn=X0+Mn+AnX_n = X_0 + M_n + A_n, con MnM_n martingala (M0=0M_0 = 0) y AnA_n predecible (Fn1\mathcal{F}_{n-1}-medible, A0=0A_0 = 0). AnA_n es el drift; MnM_n, la sorpresa.

Se construye explícitamente: AnAn1=E[XnFn1]Xn1A_n - A_{n-1} = \mathbb{E}[X_n \mid \mathcal{F}_{n-1}] - X_{n-1} (la deriva esperada, conocida un paso antes) y Mn=XnX0AnM_n = X_n - X_0 - A_n. Es el análogo en tiempo discreto de la descomposición semimartingala de Itô —"señal predecible + ruido de martingala"—, y XX es martingala     An0\iff A_n \equiv 0 (sin deriva).

Las martingalas son el lenguaje del filtrado (las innovaciones —observación menos predicción— son diferencias de martingala: ortogonales al pasado, media condicional cero), de los mercados eficientes (precios descontados son martingala bajo Q\mathbb{Q}, sin arbitraje), y del muestreo opcional (no se le gana a una martingala con una regla de parada —no hay timing infalible en un juego justo—).


Con estos cuatro, la probabilidad queda parada sobre la medida. Para la notación de todo el recorrido, mirá la simbología.