¿Por qué un LLM puede predecir texto que nunca vio?
Prerrequisitos: M00 ·
La pregunta
Un modelo de lenguaje termina frases que jamás aparecieron en su corpus, y tu agente de soporte responde tickets que nadie había escrito. Eso solo es posible si "aprender" significa algo más preciso que memorizar. Este módulo fija ese significado: qué se minimiza, cuál es el mejor predictor posible, por qué incluso ese predictor se equivoca, y qué le pasa a un modelo que solo memoriza.
La idea en una imagen
Qué mirar: cada paso es una pieza de la notación del curso. El contexto es la entrada , el siguiente token es la etiqueta , y la distribución real del lenguaje, , es lo que nadie conoce y todo modelo imita. Con dos clases es un número entre 0 y 1; con tokens, un vector de probabilidades. El módulo trabaja con dos clases porque ahí las demostraciones caben en media página.
Lo que necesitas recordar
Esperanza, varianza y esperanza condicional
Para una variable aleatoria , es su promedio ponderado por probabilidad y mide su dispersión. La esperanza condicional es el promedio de dentro de la rebanada de datos donde : la mejor predicción de cuando solo conoces , en el sentido de que minimiza sobre todas las funciones .
Ley de la esperanza total: . Promediar por rebanadas y luego promediar las rebanadas da el promedio global.
Ejemplo. (clasificación binaria): . Si , ningún clasificador puede hacerlo mejor que un volado en ese .
Dónde lo vas a usar. Es la definición de "aprender" en M01: el clasificador de Bayes es . Un LLM aprende , la misma con clases (M14). Rebana la nube en el simulador de más abajo y verás aparecer.
Notación del curso
Míralo en el simulador de esperanza condicional de más abajo. La nube son pares , la curva terracota es la estimación de y la punteada azul es la verdadera: tres símbolos de esta tabla en una sola figura.
| Símbolo | Significado | Se introduce en |
|---|---|---|
| entrada (features), salida (etiqueta o token) | M01 | |
| función de regresión | M01 | |
| clasificador, clasificador de Bayes, ERM | M01 | |
| clase de hipótesis | M01 | |
| riesgo, riesgo empírico, exceso de riesgo | M01 | |
| pérdida, pérdida sustituta | M05 | |
| muestras, dimensión, brazos o expertos | M02, M17 | |
| precisión, nivel de confianza | M02 | |
| complejidad de Rademacher | M03 | |
| dimensión VC, coeficiente de shattering | M03 | |
| número de cobertura | M04 | |
| gradiente, derivada, jacobiano | M06 | |
| suavidad, convexidad fuerte, número de condición | M07 | |
| tamaño de paso (learning rate) | M07 | |
| consultas, claves, valores | M09 | |
| parámetros, tokens, cómputo | M13 | |
| temperatura | M14 | |
| regret acumulado | M17 | |
| gap del brazo | M18 | |
| política, política de referencia, coeficiente KL | M20 |
Convenciones: es el logaritmo natural; sin subíndice es ; es la indicadora; ; log-loss es . Esta tabla es copia de la tabla de notación de docs/04 y se actualiza junto con ella.
La matemática
Rigollet abre 18.657 con dos oficios. La estadística modela: supone y estima sus parámetros. El machine learning replica la caja sin abrirla, y la teoría del aprendizaje estadístico pregunta cuántos datos hacen falta para replicarla con una precisión dada.
Fijada la entrada, la etiqueta es un volado cargado que cae en 1 con probabilidad . Cuanto más cerca de está , menos dice sobre , con todos los datos del mundo.
Sea un par aleatorio con distribución conjunta , y sean copias independientes de . Un clasificador es una función medible y su riesgo (error de clasificación) es
La función de regresión es , de modo que y con . El ruido es nulo casi seguramente si y solo si casi seguramente.
No conoces , pero tienes pares: sustituye la probabilidad de error por la frecuencia en la muestra y minimízala. Sin restricciones gana un clasificador que memoriza la muestra y nada más; los teoremas de no-free-lunch (ver "Lo que queda fuera") dicen que sin restringir la clase no hay arreglo.
El riesgo empírico de es
Para fija, y casi seguramente. Dada una clase , un minimizador del riesgo empírico (ERM) es cualquier . Sobre la clase de todos los clasificadores, la regla y fuera de la muestra cumple , pero su riesgo es una variable aleatoria que no tiene por qué ser pequeña.
Demostración de la insesgadez
Para fija, cada es una variable de Bernoulli cuya esperanza es , porque tiene la misma ley que . Por linealidad, . La ley fuerte de los grandes números, aplicada a esas variables independientes, da la convergencia casi segura. El argumento falla para porque depende de los mismos pares que se promedian: los sumandos ya no son independientes ni tienen esperanza .
Si conocieras , en cada apostarías por la etiqueta más probable y perderías con probabilidad . El promedio de eso es un piso que ningún dato adicional baja.
El clasificador de Bayes es . Para todo clasificador ,
y en particular el riesgo de Bayes satisface
con si y solo si casi seguramente.
Demostración
Los eventos y son disjuntos y su unión es , así que
Escribe cada probabilidad como esperanza de una indicadora y condiciona en (ley de la esperanza total):
Como es función de , sale de la esperanza condicional; y , . Eso es (1).
Con se tiene y , así que
Pero equivale a : en el primer sumando y en el segundo . Las dos indicadoras suman 1, luego . Por último, punto a punto, con igualdad exactamente cuando ; al tomar esperanza se obtiene la cota, y la igualdad fuerza casi seguramente.
El exceso de riesgo solo cobra donde contradice a , y cobra : casi nada donde , porque ahí nadie puede hacerlo bien, y hasta 1 donde . Por eso es no negativo y es óptimo.
Para todo clasificador , el exceso de riesgo satisface
En consecuencia , donde el ínfimo recorre todos los clasificadores medibles.
Demostración
Aplica (1) a y a y resta:
Como cada clasificador vale 0 o 1, , y lo mismo para : el segundo paréntesis es el negativo del primero. Llamando ,
Ahora vale 0 cuando y coinciden. Cuando difieren hay dos casos: si entonces , y , de modo que ; si entonces , y , de modo que . En todos los casos , que es la identidad. La forma integral es la misma esperanza escrita contra la marginal . El integrando es no negativo, así que para todo : minimiza el riesgo.
Restringir la clase elimina al memorizador, pero quizá el mejor de ya no es . El exceso de riesgo del ERM se parte en lo que pierdes por tener datos finitos y lo que pierdes por haber elegido ; solo el primero baja con .
Sea (se supone que existe) y el ERM sobre . Entonces
El segundo término no depende de los datos; para el primero, como por definición,
Una desigualdad oráculo es una cota con explícito: el ERM es casi tan bueno como el mejor de su clase sin conocer a .
Juega con esto
En el segundo simulador, son los clasificadores con de grado a lo más : en una dimensión, a lo más cambios de etiqueta, así que el ERM es exacto. La cambia de lado tres veces; ninguna clase con la sigue.
¿Y esto qué tiene que ver con mis agentes?
El predictor Bayes-óptimo del siguiente token es la distribución verdadera del lenguaje, y su riesgo no es cero: "el gato se subió al" admite varias continuaciones legítimas: ruido irreducible. Con log-loss ese piso es la entropía del lenguaje, y su exponencial es el piso de la perplejidad (M14); el ejercicio 2 hace la cuenta.
Un modelo que reproduce su corpus y contesta al azar lo demás es el ERM sin restricciones: riesgo empírico cero, riesgo real pésimo. Que un LLM no sea eso depende de cuánto restringen la clase la arquitectura y el entrenamiento (M03, M13).
Un ejemplo concreto. Tu agente de soporte de pagos clasifica cada ticket como "contracargo" o "reembolso" antes de enrutarlo. Cuando el propio cliente no distingue las dos cosas, : ningún modelo ni ningún humano baja el error ahí, y castigar al agente por esos casos es medir mal.
"Acertó 43 de 50" es , no ; cuánto pueden separarse es M02. Y si un modelo pequeño no mejora con más ejemplos, sospecha de la aproximación antes que de la estimación (M04).
Ejercicios
-
Análisis discriminante
[18.657 PS1 P1, partes 1-2]. con y , . (1) Densidad de . (2) Con definida positiva, calcula y describe la geometría de y . (3, opcional) Con , ¿qué forma tiene la frontera? Pista: escribe con la regla de Bayes (L02 §1.1) y compara con . Original: PS1 (PDF) · solución oficial. -
Riesgo de Bayes para tokens con dos pérdidas (propio). Fija un contexto y sea la distribución del siguiente token sobre un vocabulario . (a) Con pérdida 0-1, ¿cuál es el predictor de Bayes y cuánto vale ? (b) Con log-loss , con una distribución sobre , demuestra que el minimizador de es y que el mínimo es la entropía . (c) Con la distribución de la animación, , calcula ambos riesgos y di cuál importa para un LLM.
Solución del ejercicio 2
(a) y : es la versión con clases de . En el ejemplo, .
(b) Para cualquier distribución ,
donde y . La divergencia es no negativa por la desigualdad de Jensen aplicada a , que es convexa: , con igualdad si y solo si . Por tanto el mínimo es y se alcanza en .
(c) Con logaritmo natural, nats, es decir una perplejidad : como si el modelo perfecto dudara entre unas cinco continuaciones equiprobables. El riesgo 0-1 es 0.58 y solo mira el argmax: un modelo que pone 0.99 en "tejado" y otro que pone 0.42 tienen el mismo riesgo 0-1 y log-loss muy distintas. Un LLM se entrena y se evalúa con log-loss porque lo que usa es la distribución completa (muestreo, temperatura, calibración), así que su piso es la entropía, no el 0.58. M14 retoma esto.
Autoevaluación
Fuentes
[18.657 L01 §1, §2.1-2.4]caja negra vs. modelo; , y ruido; riesgo empírico y memorizador; descomposición y "sup out": Lecture 1 notes.[18.657 L02 §1.1-1.3]clasificador de Bayes, teorema (1.1)-(1.3) con su demostración cotejada línea por línea (notación y una errata de la prosa original, anotadas en comentarios), ERM y desigualdades oráculo: Lecture 2 notes.[18.657 PS1 P1]: enunciado, solución oficial.[6.7960 Lec 01]marco general: redes como clasificadores con softmax y entropía cruzada; sobreparametrización y generalización (M03): transcripción, video.[Vision Ch 12](opcional) redes como funciones: visionbook.mit.edu.- Síntesis propia: animación, simuladores, ejercicio 2 con su solución y la figura rediseñada.
Lo que queda fuera
- Regresión con pérdida cuadrática y clasificación multiclase formal con softmax: M05.
- No-free-lunch (para todo algoritmo hay una con y ): enunciado en 18.657 L01 §2.2; demostración en Devroye, Györfi y Lugosi (1996), cap. 7.
- Estimadores plug-in y regresión logística como modelo de : 18.657 L02 §1.2; The Elements of Statistical Learning, cap. 4.
- Control del supremo : M02 y M03.
Este módulo adapta material de MIT OpenCourseWare bajo licencia CC BY-NC-SA 4.0: MIT 18.657 Mathematics of Machine Learning (2015); MIT 6.7960 Deep Learning (2024). Las adaptaciones (traducción, figuras, simuladores) son propias y heredan la misma licencia. Enlaces a cada fuente en la sección Fuentes.
M02 · ¿Cuántos ejemplos necesito para confiar en mi eval de agentes?