OpenBetaMatemática

← Temas

Apéndice A — Teoremas que Rudin deja implícitos

Cinco teoremas que el análisis usa, relega a ejercicios o asume sin enunciar —y que son de los de mayor rendimiento—. El punto fijo de Banach es el motor de toda iteración convergente; Jensen es la desigualdad detrás de la teoría de la información; el criterio de Lebesgue cierra el puente entre Riemann y la medida; Dini conecta los dos modos de convergencia; y el criterio de la integral da las series pp de un golpe.

1. El teorema del punto fijo de Banach

Si una transformación encoge las distancias, iterarla converge a un único punto que deja quieto. Es la versión rigurosa de "iterá hasta que se estabilice".

Definición (contracción). T:XXT : X \to X en un espacio métrico (X,d)(X,d) es una contracción si existe L<1L < 1 con d(Tx,Ty)Ld(x,y)d(Tx, Ty) \le L\,d(x,y) para todos x,yx, y.

Teorema (Banach). Si (X,d)(X,d) es completo (no vacío) y TT es una contracción con constante L<1L < 1, entonces: (i) TT tiene un único punto fijo xx^\star; (ii) para cualquier x0x_0, la iteración xn+1=Txnx_{n+1} = T x_n converge a xx^\star; (iii) con cota de error d(xn,x)Ln1Ld(x1,x0)d(x_n, x^\star) \le \tfrac{L^n}{1-L}\,d(x_1, x_0).

Demostración. Cauchy: d(xn+1,xn)Ld(xn,xn1)Lnd(x1,x0)d(x_{n+1}, x_n) \le L\,d(x_n, x_{n-1}) \le \cdots \le L^n d(x_1, x_0); para m>nm > n, por la triangular y la serie geométrica, d(xm,xn)d(x1,x0)knLk=d(x1,x0)Ln1L0d(x_m, x_n) \le d(x_1, x_0)\sum_{k \ge n} L^k = d(x_1,x_0)\tfrac{L^n}{1-L} \to 0. Converge: por completitud, xnxXx_n \to x^\star \in X. Es fijo: TT es continua (Lipschitz), así que x=limxn+1=limTxn=Txx^\star = \lim x_{n+1} = \lim T x_n = T x^\star. Único: si Tx=xTx^\star = x^\star y Ty=yTy^\star = y^\star, entonces d(x,y)Ld(x,y)d(x^\star, y^\star) \le L\,d(x^\star, y^\star), y como 1L>01 - L > 0, la distancia es 00.   \;\blacksquare

Las dos hipótesis son indispensables. Sin completitud: en Q\mathbb{Q}, la iteración de Newton para 2\sqrt2 es una contracción pero su punto fijo 2Q\sqrt2 \notin \mathbb{Q}. Con L=1L = 1 (isometría): T(x)=x+1T(x) = x + 1 cumple TxTy=xy\lvert Tx - Ty\rvert = \lvert x - y\rvert pero no fija nada. Y el L<1L < 1 debe ser uniforme: T(x)=x+1xT(x) = x + \tfrac1x en [1,)[1,\infty) tiene T<1\lvert T'\rvert < 1 en cada punto pero T1\lvert T'\rvert \to 1, sin punto fijo.

Es el teorema que garantiza que una iteración converja: el método de Newton cerca de una raíz simple, Picard–Lindelöf (existencia y unicidad de soluciones de EDOs, como Banach sobre un espacio de funciones), y el operador de Bellman en programación dinámica (contracción de constante L=γL = \gamma, el factor de descuento).

2. La desigualdad de Jensen

Relaciona "la función del promedio" con "el promedio de la función". Para funciones convexas, hay una desigualdad universal.

Definición. φ\varphi es convexa si la cuerda queda por encima de la curva, φ(tx+(1t)y)tφ(x)+(1t)φ(y)\varphi(tx + (1-t)y) \le t\varphi(x) + (1-t)\varphi(y). Equivalente: en cada punto x0x_0 hay una recta soporte (x)=φ(x0)+m(xx0)\ell(x) = \varphi(x_0) + m(x - x_0) que toca la curva ahí y queda por debajo en todas partes.

Teorema (Jensen). Si φ\varphi es convexa y E[X]\mathbb{E}[X] es finita, φ(E[X])E[φ(X)].\varphi\bigl(\mathbb{E}[X]\bigr) \le \mathbb{E}\bigl[\varphi(X)\bigr]. (Cóncava: se invierte. Versión finita: φ(tixi)tiφ(xi)\varphi(\sum t_i x_i) \le \sum t_i \varphi(x_i), con ti0t_i \ge 0, ti=1\sum t_i = 1.)

Demostración. Sea μ=E[X]\mu = \mathbb{E}[X] y tomá la recta soporte en μ\mu: φ(x)φ(μ)+m(xμ)\varphi(x) \ge \varphi(\mu) + m(x - \mu) para todo xx. Vale puntualmente, así que la evaluás en XX y tomás esperanza (que preserva el orden): E[φ(X)]φ(μ)+m(E[X]μ)=φ(μ)\mathbb{E}[\varphi(X)] \ge \varphi(\mu) + m\,(\mathbb{E}[X] - \mu) = \varphi(\mu), porque E[Xμ]=0\mathbb{E}[X - \mu] = 0.   \;\blacksquare La igualdad ocurre solo si φ\varphi es lineal sobre el soporte de XX, o XX es constante.

Caso particular —media aritmética ≥ geométrica: con φ=ln\varphi = -\ln (convexa), ln(1nxi)1nlnxi-\ln(\tfrac1n\sum x_i) \le -\tfrac1n\sum \ln x_i, que reordenado es x1++xnnx1xnn\tfrac{x_1 + \cdots + x_n}{n} \ge \sqrt[n]{x_1 \cdots x_n}. Y es la desigualdad detrás de que la divergencia KL sea 0\ge 0 (con ln-\ln convexa, base de la teoría de la información) y de que un payoff convexo valga más que su valor en el promedio (la "prima de convexidad").

3. El criterio de Lebesgue para integrabilidad de Riemann

¿Exactamente qué funciones acotadas son Riemann-integrables? La respuesta conecta dos capítulos —y es bellísima—: lo que importa no es cuántas discontinuidades hay, sino cuánto miden.

Oscilación. osc(f,x)=limδ0+(suptx<δfinftx<δf)\operatorname{osc}(f, x) = \lim_{\delta \to 0^+}\bigl(\sup_{|t-x|<\delta} f - \inf_{|t-x|<\delta} f\bigr), el "salto local". ff es continua en xx     osc(f,x)=0\iff \operatorname{osc}(f,x) = 0.

Criterio de Lebesgue. Una ff acotada en [a,b][a,b] es Riemann-integrable si y solo si su conjunto de discontinuidades D={x:osc(f,x)>0}D = \{x : \operatorname{osc}(f,x) > 0\} tiene medida cero.

Idea de prueba. Si DD tiene medida cero, fijá ε\varepsilon: el conjunto Dε={oscε}D_\varepsilon = \{\operatorname{osc} \ge \varepsilon\} es compacto y de medida cero, se cubre con finitos intervalos de longitud total <ε< \varepsilon; afuera la oscilación es <ε< \varepsilon. Partiendo la suma ULU - L en los subintervalos "buenos" (oscilación chica) y los que tocan DεD_\varepsilon (longitud chica), ULU - L se hace arbitrariamente pequeño.   \;\blacksquare

Esto unifica todo lo de la integral de Riemann: las continuas tienen D=D = \varnothing → integrables; las monótonas tienen DD contable → medida cero → integrables; Dirichlet es discontinua en todo punto, D=[0,1]D = [0,1] de medida 11 → no integrable. Es el puente explícito hacia la integral de Lebesgue: la integrabilidad de Riemann se caracteriza con un concepto de medida.

4. El teorema de Dini

Teorema (Dini). Si KK es compacto, las fn:KRf_n : K \to \mathbb{R} son continuas, convergen monótonamente (fnff_n \nearrow f o \searrow) a una ff que es continua, entonces la convergencia es uniforme —automáticamente—.

Demostración. Con gn=ffn0g_n = f - f_n \ge 0 continua y gn0g_n \searrow 0, fijá ε\varepsilon y sea En={x:gn(x)<ε}E_n = \{x : g_n(x) < \varepsilon\}: cada EnE_n es abierto, los EnE_n crecen (por monotonía), y cubren KK (todo punto entra en alguno). Por compacidad un solo índice NN ya cubre KK, así que gn<εg_n < \varepsilon en todo KK para nNn \ge N.   \;\blacksquare

Es valioso porque regala uniformidad —el modo de convergencia fuerte— a cambio de monotonía sobre un compacto, anticipando el teorema de convergencia monótona de Lebesgue. Las cuatro hipótesis son necesarias: sin monotonía, el "pico viajero" converge puntual pero no uniforme; sin continuidad del límite, xnx^n en [0,1][0,1] sube a un límite discontinuo y no uniformemente.

5. El criterio de la integral

Criterio de la integral (Cauchy–Maclaurin). Si f:[1,)[0,)f : [1, \infty) \to [0, \infty) es positiva y decreciente, entonces n1f(n)\sum_{n \ge 1} f(n) converge     \iff la integral 1f(x)dx\int_1^\infty f(x)\,dx converge, con 1fn1f(n)f(1)+1f\int_1^\infty f \le \sum_{n \ge 1} f(n) \le f(1) + \int_1^\infty f.

Demostración. Como ff decrece, en [n,n+1][n, n+1] vale f(n+1)nn+1ff(n)f(n+1) \le \int_n^{n+1} f \le f(n) (el área queda atrapada entre los rectángulos). Sumando, n=2N+1f(n)1N+1fn=1Nf(n)\sum_{n=2}^{N+1} f(n) \le \int_1^{N+1} f \le \sum_{n=1}^N f(n): suma e integral se acotan mutuamente, así que una converge     \iff la otra.   \;\blacksquare

Las series pp sin esfuerzo: con f(x)=xpf(x) = x^{-p}, 1xpdx\int_1^\infty x^{-p}\,dx converge     p>1\iff p > 1, luego 1np\sum \tfrac1{n^p} converge     p>1\iff p > 1 —incluida la divergencia de la armónica (p=1p = 1, 1x=lnx\int \tfrac1x = \ln x \to \infty)—. Además estima la cola: n>Nf(n)Nf\sum_{n > N} f(n) \approx \int_N^\infty f, útil para saber cuántos términos truncar.


Estos cinco cierran las grietas que el curso deja entre capítulos. El Apéndice B sigue con la teoría de la medida que sostiene la probabilidad moderna.