OpenBetaMatemática

← Temas

Leyes de los grandes números y el Teorema Central del Límite

Tomá una sucesión de variables iid X1,X2,X_1, X_2, \dots con media μ\mu y varianza σ2\sigma^2, y la media muestral Xˉn=1ni=1nXi\bar X_n = \frac1n \sum_{i=1}^n X_i. Dos preguntas, dos teoremas:

  • ¿A dónde va Xˉn\bar X_n? → a μ\mu. Es la ley de los grandes números.
  • ¿Cómo fluctúa alrededor de μ\mu? → como una gaussiana de escala 1/n1/\sqrt n. Es el Teorema Central del Límite.

Para enunciarlos con precisión, primero hay que decir en qué sentido converge una sucesión de variables aleatorias —y ahí están casi todas las sutilezas.

Modos de convergencia

No hay un único "→" para variables aleatorias. Hay tres que importan:

En probabilidad:Xn  p  X    ε>0,  P(XnX>ε)0.Casi seguro (c.s.):Xn  c.s.  X    P ⁣(limnXn=X)=1.En distribucioˊn:Xn  d  X    Fn(x)F(x) en los puntos de continuidad de F.\begin{aligned} &\textbf{En probabilidad:} && X_n \xrightarrow{\;p\;} X \iff \forall \varepsilon>0,\; \mathbb{P}(|X_n - X| > \varepsilon) \to 0. \\ &\textbf{Casi seguro (c.s.):} && X_n \xrightarrow{\;\text{c.s.}\;} X \iff \mathbb{P}\!\left(\lim_n X_n = X\right) = 1. \\ &\textbf{En distribución:} && X_n \xrightarrow{\;d\;} X \iff F_n(x) \to F(x) \text{ en los puntos de continuidad de } F. \end{aligned}

La jerarquía (estrictas las implicaciones):

c.s.    en probabilidad    en distribucioˊn.\text{c.s.} \;\Longrightarrow\; \text{en probabilidad} \;\Longrightarrow\; \text{en distribución}.

En probabilidad dice que la chance de estar lejos se desvanece; casi seguro dice que la sucesión misma converge, para casi todo ω\omega. La distinción no es pedante: es la diferencia entre la ley débil y la fuerte.

Las herramientas: Markov y Chebyshev

Las dos leyes se apoyan en una sola desigualdad elemental. Vale la pena entenderla de verdad, porque es el motor de todo.

Desigualdad de Markov

La intuición: una variable no negativa no puede poner mucha masa lejos sin inflar su media. Si una fracción importante de XX valiera a\ge a, ese solo pedazo ya aportaría mucho a E[X]\mathbb{E}[X]. Formalmente, para X0X \ge 0 y a>0a > 0:

E[X]=0xdP    {Xa}xdP    {Xa}adP=aP(Xa).\mathbb{E}[X] = \int_0^\infty x\, dP \;\ge\; \int_{\{X \ge a\}} x\, dP \;\ge\; \int_{\{X \ge a\}} a\, dP = a\,\mathbb{P}(X \ge a).

El primer "\ge" es tirar la parte donde X<aX < a (integrando no negativo); el segundo, reemplazar xx por su cota inferior aa en esa región. Despejando:

  P(Xa)E[X]a  \boxed{\;\mathbb{P}(X \ge a) \le \frac{\mathbb{E}[X]}{a}\;}

Solo usa la media —ninguna otra información—, así que es válida siempre pero típicamente floja.

Desigualdad de Chebyshev

Markov mira colas de variables positivas. Para acotar cuánto se aleja de su media una variable cualquiera, aplicá Markov a Y=(Xμ)2Y = (X - \mu)^2 (que es 0\ge 0) con umbral a=ε2a = \varepsilon^2. Como el evento {(Xμ)2ε2}\{(X-\mu)^2 \ge \varepsilon^2\} es exactamente {Xμε}\{|X - \mu| \ge \varepsilon\}:

P(Xμε)=P((Xμ)2ε2)E[(Xμ)2]ε2=σ2ε2.\mathbb{P}\bigl(|X - \mu| \ge \varepsilon\bigr) = \mathbb{P}\bigl((X-\mu)^2 \ge \varepsilon^2\bigr) \le \frac{\mathbb{E}[(X-\mu)^2]}{\varepsilon^2} = \frac{\sigma^2}{\varepsilon^2}.

Midiendo la distancia en desvíos estándar (ε=kσ\varepsilon = k\sigma) queda la forma más reveladora:

  P(Xμkσ)1k2  \boxed{\;\mathbb{P}\bigl(|X - \mu| \ge k\sigma\bigr) \le \frac{1}{k^2}\;}

A lo sumo 1/k21/k^2 de la masa está a más de kk desvíos de la media —y esto vale para cualquier distribución con varianza finita, sin suponer normalidad—. A k=2k = 2: al menos el 75%75\% está dentro de 2σ2\sigma; a k=3k = 3, al menos el 89%89\%. Es flojo (la normal mete 95%95\% dentro de 2σ2\sigma, no apenas 75%75\%), pero su fuerza es que es libre de distribución. Jugá con la cota y mirá cuánto sobra:

La cota siempre vale (y suele sobrar) — interactivo
densidad de X ~ Exp(1) · μ=1, σ=1
probabilidad real0.135
cota de Markov E[X]/a0.500

Markov: P(X ≥ a) ≤ E[X]/a. La cota nunca queda por debajo de la probabilidad real —siempre vale—, pero la sobreestima bastante: usa solo la media, ninguna otra información.

Esa holgura no importa para lo que viene: alcanza y sobra para demostrar la ley débil en tres líneas.

La ley débil (WLLN)

Xˉn  p  μ\bar X_n \xrightarrow{\;p\;} \mu: para todo ε\varepsilon, P(Xˉnμε)0\mathbb{P}(|\bar X_n - \mu| \ge \varepsilon) \to 0.

Demostración (con varianza finita). La media muestral tiene E[Xˉn]=μ\mathbb{E}[\bar X_n] = \mu y, por independencia, Var(Xˉn)=σ2n\operatorname{Var}(\bar X_n) = \dfrac{\sigma^2}{n}. Chebyshev da

P(Xˉnμε)Var(Xˉn)ε2=σ2nε2n0.\mathbb{P}\bigl(|\bar X_n - \mu| \ge \varepsilon\bigr) \le \frac{\operatorname{Var}(\bar X_n)}{\varepsilon^2} = \frac{\sigma^2}{n\,\varepsilon^2} \xrightarrow[n\to\infty]{} 0. \qquad \blacksquare

Tres líneas. La varianza de la media se encoge como 1/n1/n, y eso aplasta la probabilidad de desviarse.

La ley fuerte de Kolmogorov (SLLN)

La ley débil deja una puerta abierta: que Xˉn\bar X_n se acerque "casi siempre" pero ocasionalmente pegue saltos para siempre. Kolmogorov la cierra:

Ley fuerte (Kolmogorov). Si X1,X2,X_1, X_2, \dots son iid con EX1<\mathbb{E}|X_1| < \infty, entonces Xˉn  c.s.  μ\bar X_n \xrightarrow{\;\text{c.s.}\;} \mu.

Notá la hipótesis: basta media finita, no hace falta varianza. Y la conclusión es mucho más fuerte: para casi toda realización ω\omega, la trayectoria Xˉn(ω)\bar X_n(\omega) converge a μ\mu. Mirá una trayectoria asentándose, dentro del embudo μ±2σ/n\mu \pm 2\sigma/\sqrt n:

La ley de los grandes números — interactivo
μmedia muestral X̄ₙ vs n
La media muestral X̄ₙ se asienta sobre μ = 1 a medida que n crece —eso es la ley de los grandes números—. El embudo es la banda μ ± 2σ/√n: las fluctuaciones se achican como 1/√n (el TCL lo dirá exacto). Hasta una fuente tan rara como ±1 (bimodal) obedece. Tocá ↻ para otra realización.

La maquinaria detrás es fina —la desigualdad maximal de Kolmogorov, el teorema de las tres series y la ley 0-1 (todo evento de cola tiene probabilidad 0 o 1)—. El espíritu: controlar no un término sino el supremo de las colas, lo justo para saltar de "la probabilidad tiende a 0" a "la sucesión converge con probabilidad 1".

El Teorema Central del Límite

La ley de los grandes números dice a dónde va la media; el TCL dice cómo llega. Reescalando la desviación por n\sqrt n:

Xˉnμσ/n=n(Xˉnμ)σ  d  N(0,1).\frac{\bar X_n - \mu}{\sigma/\sqrt n} = \frac{\sqrt n\,(\bar X_n - \mu)}{\sigma} \xrightarrow{\;d\;} N(0,1).

Lo asombroso es la universalidad: no importa la forma de la fuente —sesgada, discreta, bimodal—, las medias estandarizadas convergen a la misma campana. Subí nn y miralo colapsar:

El Teorema Central del Límite — interactivo
N(0,1)
n = 2 (muestras por media)2400 medias estandarizadas
Cada barra es el histograma de √n·(X̄ₙ − μ)/σ sobre 2400 muestras. Con n = 1 ves la forma cruda de la fuente (sesgada, bimodal…). Subí n y, venga de donde venga, el histograma colapsa a la campana N(0,1). Eso es el TCL: las fluctuaciones de la media, reescaladas por √n, son universalmente gaussianas. Por eso la normal aparece en todos lados —y por qué los errores estándar van como σ/√n.

Bosquejo de la prueba (funciones características). La función característica φ(t)=E[eitX]\varphi(t) = \mathbb{E}[e^{itX}] determina la ley y convierte sumas en productos. Para Zn=1σn(Xiμ)Z_n = \frac{1}{\sigma\sqrt n}\sum (X_i - \mu), la independencia da φZn(t)=[φ(Xμ)/σ ⁣(t/n)]n\varphi_{Z_n}(t) = \bigl[\varphi_{(X-\mu)/\sigma}\!\left(t/\sqrt n\right)\bigr]^n. Expandiendo a segundo orden (media 00, varianza 11): φ(s)=1s22+o(s2)\varphi(s) = 1 - \tfrac{s^2}{2} + o(s^2), así que

φZn(t)=(1t22n+o ⁣(1n))nnet2/2,\varphi_{Z_n}(t) = \left(1 - \frac{t^2}{2n} + o\!\left(\tfrac1n\right)\right)^{n} \xrightarrow[n\to\infty]{} e^{-t^2/2},

que es la función característica de la N(0,1)N(0,1). Por el teorema de continuidad de Lévy, la convergencia de las características implica convergencia en distribución.   \;\blacksquare

La lectura conjunta

Los dos teoremas, juntos, describen la media muestral por completo:

Xˉn=μLLN: el centro+Op ⁣(1n)TCL: la fluctuacioˊn gaussiana.\bar X_n = \underbrace{\mu}_{\text{LLN: el centro}} + \underbrace{O_p\!\left(\frac{1}{\sqrt n}\right)}_{\text{TCL: la fluctuación gaussiana}}.

La LLN te da consistencia (el estimador acierta el blanco); el TCL te da la forma y el tamaño del error alrededor del blanco.

Por qué esto está en el corazón de la estadística

  • Consistencia de estimadores: que θ^nθ\hat\theta_n \to \theta es, en el fondo, una ley de los grandes números.
  • Intervalos de confianza: θ^±zσ^n\hat\theta \pm z\,\dfrac{\hat\sigma}{\sqrt n} sale directo del TCL —la normalidad asintótica es lo que justifica el ±1.96\pm 1.96.
  • Monte Carlo: la LLN dice que el promedio de simulaciones converge al valor buscado; el TCL te da las barras de error σ/n\sigma/\sqrt n. Por eso para ganar un dígito de precisión hacés falta 100×100\times más muestras.
  • El n\sqrt n no es casualidad: es la tasa universal de la estadística, y sale de que la varianza de un promedio cae como 1/n1/n.

Con esto en la mano, ya podemos hablar en serio de estimadores y sus propiedades: el siguiente paso de la inferencia.