Bloque 0 M00 1.5 h

Mapa del curso y kit matemático

Sin prerrequisitos ·

La pregunta

Vas a orquestar agentes toda la semana y, en las horas que le des a este curso, quieres entender por qué funcionan. El problema es práctico: hay 24 módulos por delante y cuatro herramientas matemáticas que todos usan. Antes de la primera demostración conviene ver el mapa entero y comprobar, en diez minutos, cuáles de esas herramientas siguen frescas.

Este módulo es tres cosas a la vez: la portada, un diagnóstico, y un lugar al que volver cuando una notación no te suene.

La idea en una imagen

Cada módulo abre con una pregunta de LLMs o agentes y baja solo a la matemática necesaria. Las flechas son prerrequisitos reales: si un módulo apunta a otro, la demostración del segundo usa un resultado del primero. El bloque F se puede leer en cualquier momento.

Lo que necesitas recordar

Siete tarjetas. Ábrelas en orden si el diagnóstico te lo pide; si no, vuelve cuando un módulo las cite.

Vectores y normas

Un vector es a la vez una flecha (dirección y tamaño) y una lista de números. El producto interior mide cuánto apuntan al mismo lado; la norma mide el tamaño, y hay varias maneras de medirlo:

Para matrices: la norma de Frobenius trata a como un vector largo; la norma espectral es el mayor estiramiento que produce.

Ejemplo. : , , . Siempre .

Dónde lo vas a usar. La bola unitaria de cada norma tiene una forma distinta; esa forma decide la dirección de "descenso más pronunciado" en M08 y aparece en la regularización y en la cuantización (M16). Juega con el explorador de normas más abajo.

Matrices como transformaciones y la SVD

Míralo en la superficie de más abajo. La función del simulador del plano tangente es la forma cuadrática con : sus curvas de nivel son elipses cuyos semiejes están en razón , la raíz de la razón entre los valores singulares y de (el círculo unitario, en cambio, se transforma bajo en una elipse con razón ). La vista 2-D del mismo simulador dibuja esas curvas de nivel.

Una matriz es una función lineal . Su rango es la dimensión de la imagen. Toda matriz se factoriza como

con y ortogonales y diagonal con (valores singulares). Léelo así: rota (), estira cada eje por (), rota otra vez (). La norma espectral es y .

La proyección ortogonal sobre un subespacio es la matriz con ; es el punto de más cercano a .

Ejemplo. manda el círculo unitario a una elipse con semiejes 3 y 1: , .

Dónde lo vas a usar. El autoencoder lineal aprende exactamente los primeros vectores singulares (M10); LoRA apuesta a que el cambio de pesos tiene pocos valores singulares grandes (M15); el número de condición gobierna la velocidad del descenso de gradiente (M07).

Derivada como mejor aproximación lineal y gradiente

Para , la derivada en es la función lineal que mejor aproxima a cerca de :

Cuando eliges coordenadas, : el gradiente es el vector que representa a la derivada, y apunta en la dirección de máximo ascenso. Para la derivada se representa con el jacobiano .

Convexidad en una imagen: es convexa si el segmento entre dos puntos de la gráfica queda por encima de la gráfica; si además es diferenciable, la tangente queda por debajo: .

Ejemplo. con simétrica: . Compruébalo con : , .

Dónde lo vas a usar. Es el objeto central del bloque B: backprop es la regla de la cadena para esta derivada (M06), y el descenso de gradiente es "camina contra " (M07). Mira la animación de la secante que se vuelve tangente y la superficie con su plano tangente más abajo.

Regla de la cadena
x g(x) f(g(x)) L J_g (k×d) J_f (m×k) ∇ℓ (1×m)
La cadena y sus jacobianosQué mirar: Hacia adelante viajan valores; hacia atrás, un vector fila por cada jacobiano, de derecha a izquierda

Si y , entonces : la derivada de la composición es la composición de las derivadas. En jacobianos, , un producto de matrices.

Para una pérdida escalar , el gradiente respecto a es el producto de jacobianos aplicado a un vector. Multiplicar de derecha a izquierda (empezando por la salida escalar) cuesta ; de izquierda a derecha cuesta veces más. Esa elección de orden es backprop.

Ejemplo. : .

Dónde lo vas a usar. M06 deriva backprop completo para un MLP con softmax; M09 usa la misma cadena para explicar por qué el gradiente de una RNN se desvanece.

Esperanza, varianza y esperanza condicional

Para una variable aleatoria , es su promedio ponderado por probabilidad y mide su dispersión. La esperanza condicional es el promedio de dentro de la rebanada de datos donde : la mejor predicción de cuando solo conoces , en el sentido de que minimiza sobre todas las funciones .

Ley de la esperanza total: . Promediar por rebanadas y luego promediar las rebanadas da el promedio global.

Ejemplo. (clasificación binaria): . Si , ningún clasificador puede hacerlo mejor que un volado en ese .

Dónde lo vas a usar. Es la definición de "aprender" en M01: el clasificador de Bayes es . Un LLM aprende , la misma con clases (M14). Rebana la nube en el simulador de más abajo y verás aparecer.

Markov, Chebyshev y por qué no bastan
t X (identidad) t · 𝟙(X ≥ t)
El truco de MarkovQué mirar: La curva terracota nunca supera a la azul; tomar esperanza conserva la desigualdad, t·ℙ(X ≥ t) ≤ 𝔼[X]

Markov: si , entonces para todo . Chebyshev: . Ambas se demuestran en la sección La matemática de este módulo.

Aplicadas a una media muestral de variables con varianza , Chebyshev da : la ley de los grandes números con una tasa . Es una tasa honesta pero floja. Para variables acotadas, Hoeffding la mejora a , exponencial en .

Ejemplo. Un eval con 100 casos y tasa de éxito real 0.8. Chebyshev: la probabilidad de desviarse 0.1 es a lo más . Hoeffding: a lo más para 0.1 pero para 0.2, mientras Chebyshev solo da 0.04.

Dónde lo vas a usar. M02 demuestra Hoeffding y lo convierte en tamaños de eval; M18 lo usa brazo por brazo en UCB.

Notación del curso

Míralo en el simulador de esperanza condicional de más abajo. La nube son pares , la curva terracota es la estimación de y la punteada azul es la verdadera: tres símbolos de esta tabla en una sola figura.

Símbolo Significado Se introduce en
entrada (features), salida (etiqueta o token) M01
función de regresión M01
clasificador, clasificador de Bayes, ERM M01
clase de hipótesis M01
riesgo, riesgo empírico, exceso de riesgo M01
pérdida, pérdida sustituta M05
muestras, dimensión, brazos o expertos M02, M17
precisión, nivel de confianza M02
complejidad de Rademacher M03
dimensión VC, coeficiente de shattering M03
número de cobertura M04
gradiente, derivada, jacobiano M06
suavidad, convexidad fuerte, número de condición M07
tamaño de paso (learning rate) M07
consultas, claves, valores M09
parámetros, tokens, cómputo M13
temperatura M14
regret acumulado M17
gap del brazo M18
política, política de referencia, coeficiente KL M20

Convenciones: es el logaritmo natural; sin subíndice es ; es la indicadora; ; log-loss es . Esta tabla es copia de la tabla de notación de docs/04 y se actualiza junto con ella.

La matemática

Dos desigualdades cortas fijan el nivel de rigor del curso desde el minuto uno: se demuestra todo lo que se afirma, y se dice cuando algo se omite.

Desigualdad de Markovbásicosíntesis propia; se usa en [18.657 L02 §1.4] paso (1.5)
Intuición

Si una cantidad no negativa tiene promedio 2, no puede valer 10 o más con probabilidad mayor que un quinto: si lo hiciera, ese quinto solo ya empujaría el promedio por encima de 2.

Enunciado

Sea una variable aleatoria con y . Para todo ,

Demostración

Como , para todo resultado vale la desigualdad puntual : si el lado izquierdo es ; si el lado izquierdo es . Tomando esperanza en ambos lados, que preserva desigualdades,

Dividir entre termina la demostración.

Desigualdad de Chebyshevbásicosíntesis propia
Intuición

Es Markov aplicada al cuadrado de la desviación. Por eso la cota decae como y no como : la varianza castiga las desviaciones grandes al cuadrado.

Enunciado

Sea con . Para todo ,

Demostración

El evento es el mismo que . La variable es no negativa y . Markov con en lugar de da

Descomposición en valores singularesmedio[18.06SC] Unit III, Singular Value Decomposition
Enunciado

Toda se escribe como con y ortogonales y diagonal rectangular con entradas . Además , y el rango es el número de .

Solo enunciado · [18.06SC]

La existencia se demuestra diagonalizando , que es simétrica y semidefinida positiva. Se usa como hecho en M10 y M15.

Proyección ortogonalmedio[18.657 L12 §2.3]
Enunciado

Si es un subespacio, existe una única matriz con e imagen . Para todo , es el único punto de que minimiza sobre , y para todo .

Solo enunciado · [18.657 L12 §2.3]

La versión para conjuntos convexos cerrados, junto con la no expansividad de la proyección, se demuestra en M07.

Juega con esto

¿Y esto qué tiene que ver con mis agentes?

La esperanza condicional es lo que un modelo de lenguaje intenta aprender: la distribución del siguiente token dado el contexto. Cuando tu agente falla en un caso, la pregunta de fondo es si era ambigua ahí (ruido irreducible) o si el modelo la aproxima mal (estimación o aproximación). Ese vocabulario se construye en M01.

Nada del kit es gratuito:

Herramienta Dónde la vas a usar
Normas y bolas unitarias Velocidad de convergencia y descenso más pronunciado (M07, M08); error de cuantización (M16)
SVD y proyección Autoencoder lineal y PCA (M10); LoRA como bajo rango (M15); gradiente proyectado (M07)
Derivada y gradiente Backprop (M06); todo el bloque B
Regla de la cadena Backprop (M06); gradientes que se desvanecen en RNN (M09)
Esperanza condicional Clasificador de Bayes (M01); perplejidad y calibración (M14)
Markov y Chebyshev Hoeffding y tamaños de eval (M02); UCB (M18)
Notación Todos los módulos; los papers de la línea attention, scaling, DPO usan la misma

Un ejemplo concreto del trabajo: "el agente acertó 43 de 50 casos" es una media muestral. Chebyshev ya te dice algo sobre cuánto puede alejarse de la tasa real; M02 te dará la respuesta afilada.

Autoevaluación

Doce preguntas, tres por herramienta. El resultado se guarda para compararlo al final del curso.

Fuentes

Lo que queda fuera

Este módulo adapta material de MIT OpenCourseWare bajo licencia CC BY-NC-SA 4.0: MIT 18.650 Statistics for Applications (2016); MIT 18.657 Mathematics of Machine Learning (2015); MIT 18.S096 Matrix Calculus for Machine Learning and Beyond (2023); MIT 6.7960 Deep Learning (2024). Las adaptaciones (traducción, figuras, simuladores) son propias y heredan la misma licencia. Enlaces a cada fuente en la sección Fuentes.

Siguiente
M01 · ¿Por qué un LLM puede predecir texto que nunca vio?