Mapa del curso y kit matemático
Sin prerrequisitos ·
La pregunta
Vas a orquestar agentes toda la semana y, en las horas que le des a este curso, quieres entender por qué funcionan. El problema es práctico: hay 24 módulos por delante y cuatro herramientas matemáticas que todos usan. Antes de la primera demostración conviene ver el mapa entero y comprobar, en diez minutos, cuáles de esas herramientas siguen frescas.
Este módulo es tres cosas a la vez: la portada, un diagnóstico, y un lugar al que volver cuando una notación no te suene.
La idea en una imagen
Cada módulo abre con una pregunta de LLMs o agentes y baja solo a la matemática necesaria. Las flechas son prerrequisitos reales: si un módulo apunta a otro, la demostración del segundo usa un resultado del primero. El bloque F se puede leer en cualquier momento.
Lo que necesitas recordar
Siete tarjetas. Ábrelas en orden si el diagnóstico te lo pide; si no, vuelve cuando un módulo las cite.
Vectores y normas
Un vector es a la vez una flecha (dirección y tamaño) y una lista de números. El producto interior mide cuánto apuntan al mismo lado; la norma mide el tamaño, y hay varias maneras de medirlo:
Para matrices: la norma de Frobenius trata a como un vector largo; la norma espectral es el mayor estiramiento que produce.
Ejemplo. : , , . Siempre .
Dónde lo vas a usar. La bola unitaria de cada norma tiene una forma distinta; esa forma decide la dirección de "descenso más pronunciado" en M08 y aparece en la regularización y en la cuantización (M16). Juega con el explorador de normas más abajo.
Matrices como transformaciones y la SVD
Míralo en la superficie de más abajo. La función del simulador del plano tangente es la forma cuadrática con : sus curvas de nivel son elipses cuyos semiejes están en razón , la raíz de la razón entre los valores singulares y de (el círculo unitario, en cambio, se transforma bajo en una elipse con razón ). La vista 2-D del mismo simulador dibuja esas curvas de nivel.
Una matriz es una función lineal . Su rango es la dimensión de la imagen. Toda matriz se factoriza como
con y ortogonales y diagonal con (valores singulares). Léelo así: rota (), estira cada eje por (), rota otra vez (). La norma espectral es y .
La proyección ortogonal sobre un subespacio es la matriz con ; es el punto de más cercano a .
Ejemplo. manda el círculo unitario a una elipse con semiejes 3 y 1: , .
Dónde lo vas a usar. El autoencoder lineal aprende exactamente los primeros vectores singulares (M10); LoRA apuesta a que el cambio de pesos tiene pocos valores singulares grandes (M15); el número de condición gobierna la velocidad del descenso de gradiente (M07).
Derivada como mejor aproximación lineal y gradiente
Para , la derivada en es la función lineal que mejor aproxima a cerca de :
Cuando eliges coordenadas, : el gradiente es el vector que representa a la derivada, y apunta en la dirección de máximo ascenso. Para la derivada se representa con el jacobiano .
Convexidad en una imagen: es convexa si el segmento entre dos puntos de la gráfica queda por encima de la gráfica; si además es diferenciable, la tangente queda por debajo: .
Ejemplo. con simétrica: . Compruébalo con : , .
Dónde lo vas a usar. Es el objeto central del bloque B: backprop es la regla de la cadena para esta derivada (M06), y el descenso de gradiente es "camina contra " (M07). Mira la animación de la secante que se vuelve tangente y la superficie con su plano tangente más abajo.
Regla de la cadena
Si y , entonces : la derivada de la composición es la composición de las derivadas. En jacobianos, , un producto de matrices.
Para una pérdida escalar , el gradiente respecto a es el producto de jacobianos aplicado a un vector. Multiplicar de derecha a izquierda (empezando por la salida escalar) cuesta ; de izquierda a derecha cuesta veces más. Esa elección de orden es backprop.
Ejemplo. : .
Dónde lo vas a usar. M06 deriva backprop completo para un MLP con softmax; M09 usa la misma cadena para explicar por qué el gradiente de una RNN se desvanece.
Esperanza, varianza y esperanza condicional
Para una variable aleatoria , es su promedio ponderado por probabilidad y mide su dispersión. La esperanza condicional es el promedio de dentro de la rebanada de datos donde : la mejor predicción de cuando solo conoces , en el sentido de que minimiza sobre todas las funciones .
Ley de la esperanza total: . Promediar por rebanadas y luego promediar las rebanadas da el promedio global.
Ejemplo. (clasificación binaria): . Si , ningún clasificador puede hacerlo mejor que un volado en ese .
Dónde lo vas a usar. Es la definición de "aprender" en M01: el clasificador de Bayes es . Un LLM aprende , la misma con clases (M14). Rebana la nube en el simulador de más abajo y verás aparecer.
Markov, Chebyshev y por qué no bastan
Markov: si , entonces para todo . Chebyshev: . Ambas se demuestran en la sección La matemática de este módulo.
Aplicadas a una media muestral de variables con varianza , Chebyshev da : la ley de los grandes números con una tasa . Es una tasa honesta pero floja. Para variables acotadas, Hoeffding la mejora a , exponencial en .
Ejemplo. Un eval con 100 casos y tasa de éxito real 0.8. Chebyshev: la probabilidad de desviarse 0.1 es a lo más . Hoeffding: a lo más para 0.1 pero para 0.2, mientras Chebyshev solo da 0.04.
Dónde lo vas a usar. M02 demuestra Hoeffding y lo convierte en tamaños de eval; M18 lo usa brazo por brazo en UCB.
Notación del curso
Míralo en el simulador de esperanza condicional de más abajo. La nube son pares , la curva terracota es la estimación de y la punteada azul es la verdadera: tres símbolos de esta tabla en una sola figura.
| Símbolo | Significado | Se introduce en |
|---|---|---|
| entrada (features), salida (etiqueta o token) | M01 | |
| función de regresión | M01 | |
| clasificador, clasificador de Bayes, ERM | M01 | |
| clase de hipótesis | M01 | |
| riesgo, riesgo empírico, exceso de riesgo | M01 | |
| pérdida, pérdida sustituta | M05 | |
| muestras, dimensión, brazos o expertos | M02, M17 | |
| precisión, nivel de confianza | M02 | |
| complejidad de Rademacher | M03 | |
| dimensión VC, coeficiente de shattering | M03 | |
| número de cobertura | M04 | |
| gradiente, derivada, jacobiano | M06 | |
| suavidad, convexidad fuerte, número de condición | M07 | |
| tamaño de paso (learning rate) | M07 | |
| consultas, claves, valores | M09 | |
| parámetros, tokens, cómputo | M13 | |
| temperatura | M14 | |
| regret acumulado | M17 | |
| gap del brazo | M18 | |
| política, política de referencia, coeficiente KL | M20 |
Convenciones: es el logaritmo natural; sin subíndice es ; es la indicadora; ; log-loss es . Esta tabla es copia de la tabla de notación de docs/04 y se actualiza junto con ella.
La matemática
Dos desigualdades cortas fijan el nivel de rigor del curso desde el minuto uno: se demuestra todo lo que se afirma, y se dice cuando algo se omite.
Si una cantidad no negativa tiene promedio 2, no puede valer 10 o más con probabilidad mayor que un quinto: si lo hiciera, ese quinto solo ya empujaría el promedio por encima de 2.
Sea una variable aleatoria con y . Para todo ,
Demostración
Como , para todo resultado vale la desigualdad puntual : si el lado izquierdo es ; si el lado izquierdo es . Tomando esperanza en ambos lados, que preserva desigualdades,
Dividir entre termina la demostración.
Es Markov aplicada al cuadrado de la desviación. Por eso la cota decae como y no como : la varianza castiga las desviaciones grandes al cuadrado.
Sea con . Para todo ,
Demostración
El evento es el mismo que . La variable es no negativa y . Markov con en lugar de da
Toda se escribe como con y ortogonales y diagonal rectangular con entradas . Además , y el rango es el número de .
Si es un subespacio, existe una única matriz con e imagen . Para todo , es el único punto de que minimiza sobre , y para todo .
La versión para conjuntos convexos cerrados, junto con la no expansividad de la proyección, se demuestra en M07.
Juega con esto
¿Y esto qué tiene que ver con mis agentes?
La esperanza condicional es lo que un modelo de lenguaje intenta aprender: la distribución del siguiente token dado el contexto. Cuando tu agente falla en un caso, la pregunta de fondo es si era ambigua ahí (ruido irreducible) o si el modelo la aproxima mal (estimación o aproximación). Ese vocabulario se construye en M01.
Nada del kit es gratuito:
| Herramienta | Dónde la vas a usar |
|---|---|
| Normas y bolas unitarias | Velocidad de convergencia y descenso más pronunciado (M07, M08); error de cuantización (M16) |
| SVD y proyección | Autoencoder lineal y PCA (M10); LoRA como bajo rango (M15); gradiente proyectado (M07) |
| Derivada y gradiente | Backprop (M06); todo el bloque B |
| Regla de la cadena | Backprop (M06); gradientes que se desvanecen en RNN (M09) |
| Esperanza condicional | Clasificador de Bayes (M01); perplejidad y calibración (M14) |
| Markov y Chebyshev | Hoeffding y tamaños de eval (M02); UCB (M18) |
| Notación | Todos los módulos; los papers de la línea attention, scaling, DPO usan la misma |
Un ejemplo concreto del trabajo: "el agente acertó 43 de 50 casos" es una media muestral. Chebyshev ya te dice algo sobre cuánto puede alejarse de la tasa real; M02 te dará la respuesta afilada.
Autoevaluación
Doce preguntas, tres por herramienta. El resultado se guarda para compararlo al final del curso.
Fuentes
[18.657 L01 §1-2]marco "caja negra vs. modelar" y notación base: Lecture 1 notes.[18.657 L02 §1.4]demostración de Hoeffding, donde Markov aparece como el paso (1.5); Markov y Chebyshev se demuestran aquí como síntesis propia (son estándar; repaso en 18.05 y 18.650): Lecture 2 notes.[6.7960 Notation]convenciones de deep learning: notation PDF.[18.S096 Lec 1.1, 1.2]derivada como operador lineal (la norma espectral aparece ahí solo como ejemplo de función de matriz): Lec 1.1, Lec 1.2.- Repaso si el diagnóstico sale bajo: 18.05 Introduction to Probability and Statistics (primavera 2022), 18.06SC Linear Algebra, 18.650 Statistics for Applications.
- Síntesis propia: las tarjetas del kit, los simuladores y la tabla "herramienta → dónde".
Lo que queda fuera
- Análisis real formal (compacidad, medida, integrabilidad): se asume la madurez. Cuando un módulo necesite una hipótesis técnica se dirá en una nota.
- Demostración de la SVD (diagonalizar ): 18.06SC, Unit III. Propiedades de la proyección sobre convexos: 18.657 L12 §2.3, demostradas en M07.
Este módulo adapta material de MIT OpenCourseWare bajo licencia CC BY-NC-SA 4.0: MIT 18.650 Statistics for Applications (2016); MIT 18.657 Mathematics of Machine Learning (2015); MIT 18.S096 Matrix Calculus for Machine Learning and Beyond (2023); MIT 6.7960 Deep Learning (2024). Las adaptaciones (traducción, figuras, simuladores) son propias y heredan la misma licencia. Enlaces a cada fuente en la sección Fuentes.
M01 · ¿Por qué un LLM puede predecir texto que nunca vio?