Bloque A M01 1.5 h + 1 h ejercicios

¿Por qué un LLM puede predecir texto que nunca vio?

Prerrequisitos: M00 ·

La pregunta

Un modelo de lenguaje termina frases que jamás aparecieron en su corpus, y tu agente de soporte responde tickets que nadie había escrito. Eso solo es posible si "aprender" significa algo más preciso que memorizar. Este módulo fija ese significado: qué se minimiza, cuál es el mejor predictor posible, por qué incluso ese predictor se equivoca, y qué le pasa a un modelo que solo memoriza.

La idea en una imagen

Qué mirar: cada paso es una pieza de la notación del curso. El contexto es la entrada , el siguiente token es la etiqueta , y la distribución real del lenguaje, , es lo que nadie conoce y todo modelo imita. Con dos clases es un número entre 0 y 1; con tokens, un vector de probabilidades. El módulo trabaja con dos clases porque ahí las demostraciones caben en media página.

Lo que necesitas recordar

Esperanza, varianza y esperanza condicional

Para una variable aleatoria , es su promedio ponderado por probabilidad y mide su dispersión. La esperanza condicional es el promedio de dentro de la rebanada de datos donde : la mejor predicción de cuando solo conoces , en el sentido de que minimiza sobre todas las funciones .

Ley de la esperanza total: . Promediar por rebanadas y luego promediar las rebanadas da el promedio global.

Ejemplo. (clasificación binaria): . Si , ningún clasificador puede hacerlo mejor que un volado en ese .

Dónde lo vas a usar. Es la definición de "aprender" en M01: el clasificador de Bayes es . Un LLM aprende , la misma con clases (M14). Rebana la nube en el simulador de más abajo y verás aparecer.

Notación del curso

Míralo en el simulador de esperanza condicional de más abajo. La nube son pares , la curva terracota es la estimación de y la punteada azul es la verdadera: tres símbolos de esta tabla en una sola figura.

Símbolo Significado Se introduce en
entrada (features), salida (etiqueta o token) M01
función de regresión M01
clasificador, clasificador de Bayes, ERM M01
clase de hipótesis M01
riesgo, riesgo empírico, exceso de riesgo M01
pérdida, pérdida sustituta M05
muestras, dimensión, brazos o expertos M02, M17
precisión, nivel de confianza M02
complejidad de Rademacher M03
dimensión VC, coeficiente de shattering M03
número de cobertura M04
gradiente, derivada, jacobiano M06
suavidad, convexidad fuerte, número de condición M07
tamaño de paso (learning rate) M07
consultas, claves, valores M09
parámetros, tokens, cómputo M13
temperatura M14
regret acumulado M17
gap del brazo M18
política, política de referencia, coeficiente KL M20

Convenciones: es el logaritmo natural; sin subíndice es ; es la indicadora; ; log-loss es . Esta tabla es copia de la tabla de notación de docs/04 y se actualiza junto con ella.

La matemática

Rigollet abre 18.657 con dos oficios. La estadística modela: supone y estima sus parámetros. El machine learning replica la caja sin abrirla, y la teoría del aprendizaje estadístico pregunta cuántos datos hacen falta para replicarla con una precisión dada.

entrada X caja negra salida Y machine learning: replicar entrada X y = f(x) + ε salida Y estadística: modelar
Caja negra vs. modeloQué mirar: A la izquierda solo importa predecir la salida; a la derecha se escribe lo que hay dentro
Riesgo, función de regresión y ruidobásico[18.657 L01 §2.1]
Intuición

Fijada la entrada, la etiqueta es un volado cargado que cae en 1 con probabilidad . Cuanto más cerca de está , menos dice sobre , con todos los datos del mundo.

Enunciado

Sea un par aleatorio con distribución conjunta , y sean copias independientes de . Un clasificador es una función medible y su riesgo (error de clasificación) es

La función de regresión es , de modo que y con . El ruido es nulo casi seguramente si y solo si casi seguramente.

Riesgo empírico, ERM y el clasificador que memorizabásico[18.657 L01 §2.2; L02 §1.2]
Intuición

No conoces , pero tienes pares: sustituye la probabilidad de error por la frecuencia en la muestra y minimízala. Sin restricciones gana un clasificador que memoriza la muestra y nada más; los teoremas de no-free-lunch (ver "Lo que queda fuera") dicen que sin restringir la clase no hay arreglo.

Enunciado

El riesgo empírico de es

Para fija, y casi seguramente. Dada una clase , un minimizador del riesgo empírico (ERM) es cualquier . Sobre la clase de todos los clasificadores, la regla y fuera de la muestra cumple , pero su riesgo es una variable aleatoria que no tiene por qué ser pequeña.

Demostración de la insesgadez

Para fija, cada es una variable de Bernoulli cuya esperanza es , porque tiene la misma ley que . Por linealidad, . La ley fuerte de los grandes números, aplicada a esas variables independientes, da la convergencia casi segura. El argumento falla para porque depende de los mismos pares que se promedian: los sumandos ya no son independientes ni tienen esperanza .

El riesgo de Bayes vale 𝔼[min(η, 1 − η)] ≤ 1/2medio[18.657 L02 §1.1, ecs. (1.2)-(1.3)]
Intuición

Si conocieras , en cada apostarías por la etiqueta más probable y perderías con probabilidad . El promedio de eso es un piso que ningún dato adicional baja.

Enunciado

El clasificador de Bayes es . Para todo clasificador ,

y en particular el riesgo de Bayes satisface

con si y solo si casi seguramente.

Demostración

Los eventos y son disjuntos y su unión es , así que

Escribe cada probabilidad como esperanza de una indicadora y condiciona en (ley de la esperanza total):

Como es función de , sale de la esperanza condicional; y , . Eso es (1).

Con se tiene y , así que

Pero equivale a : en el primer sumando y en el segundo . Las dos indicadoras suman 1, luego . Por último, punto a punto, con igualdad exactamente cuando ; al tomar esperanza se obtiene la cota, y la igualdad fuerza casi seguramente.

Identidad del exceso de riesgo y optimalidad de Bayesmedio[18.657 L02 §1.1, teorema y ec. (1.1)]
Intuición

El exceso de riesgo solo cobra donde contradice a , y cobra : casi nada donde , porque ahí nadie puede hacerlo bien, y hasta 1 donde . Por eso es no negativo y es óptimo.

Enunciado

Para todo clasificador , el exceso de riesgo satisface

En consecuencia , donde el ínfimo recorre todos los clasificadores medibles.

Demostración

Aplica (1) a y a y resta:

Como cada clasificador vale 0 o 1, , y lo mismo para : el segundo paréntesis es el negativo del primero. Llamando ,

Ahora vale 0 cuando y coinciden. Cuando difieren hay dos casos: si entonces , y , de modo que ; si entonces , y , de modo que . En todos los casos , que es la identidad. La forma integral es la misma esperanza escrita contra la marginal . El integrando es no negativo, así que para todo : minimiza el riesgo.

Descomposición estimación / aproximación y desigualdades oráculomedio[18.657 L01 §2.4; L02 §1.3]
Intuición

Restringir la clase elimina al memorizador, pero quizá el mejor de ya no es . El exceso de riesgo del ERM se parte en lo que pierdes por tener datos finitos y lo que pierdes por haber elegido ; solo el primero baja con .

Enunciado

Sea (se supone que existe) y el ERM sobre . Entonces

El segundo término no depende de los datos; para el primero, como por definición,

Una desigualdad oráculo es una cota con explícito: el ERM es casi tan bueno como el mejor de su clase sin conocer a .

Solo enunciado · [18.657 L01 §2.4, pp. 5-6; L02 §1.3, pp. 5-6]

El paso "sup out" cambia una variable que depende de los datos de forma complicada por el supremo de un proceso empírico; controlarlo es el trabajo de M02 ( finita) y M03 ( infinita).

Juega con esto

En el segundo simulador, son los clasificadores con de grado a lo más : en una dimensión, a lo más cambios de etiqueta, así que el ERM es exacto. La cambia de lado tres veces; ninguna clase con la sigue.

¿Y esto qué tiene que ver con mis agentes?

El predictor Bayes-óptimo del siguiente token es la distribución verdadera del lenguaje, y su riesgo no es cero: "el gato se subió al" admite varias continuaciones legítimas: ruido irreducible. Con log-loss ese piso es la entropía del lenguaje, y su exponencial es el piso de la perplejidad (M14); el ejercicio 2 hace la cuenta.

Un modelo que reproduce su corpus y contesta al azar lo demás es el ERM sin restricciones: riesgo empírico cero, riesgo real pésimo. Que un LLM no sea eso depende de cuánto restringen la clase la arquitectura y el entrenamiento (M03, M13).

Un ejemplo concreto. Tu agente de soporte de pagos clasifica cada ticket como "contracargo" o "reembolso" antes de enrutarlo. Cuando el propio cliente no distingue las dos cosas, : ningún modelo ni ningún humano baja el error ahí, y castigar al agente por esos casos es medir mal.

"Acertó 43 de 50" es , no ; cuánto pueden separarse es M02. Y si un modelo pequeño no mejora con más ejemplos, sospecha de la aproximación antes que de la estimación (M04).

Ejercicios

  1. Análisis discriminante [18.657 PS1 P1, partes 1-2]. con y , . (1) Densidad de . (2) Con definida positiva, calcula y describe la geometría de y . (3, opcional) Con , ¿qué forma tiene la frontera? Pista: escribe con la regla de Bayes (L02 §1.1) y compara con . Original: PS1 (PDF) · solución oficial.

  2. Riesgo de Bayes para tokens con dos pérdidas (propio). Fija un contexto y sea la distribución del siguiente token sobre un vocabulario . (a) Con pérdida 0-1, ¿cuál es el predictor de Bayes y cuánto vale ? (b) Con log-loss , con una distribución sobre , demuestra que el minimizador de es y que el mínimo es la entropía . (c) Con la distribución de la animación, , calcula ambos riesgos y di cuál importa para un LLM.

Solución del ejercicio 2

(a) y : es la versión con clases de . En el ejemplo, .

(b) Para cualquier distribución ,

donde y . La divergencia es no negativa por la desigualdad de Jensen aplicada a , que es convexa: , con igualdad si y solo si . Por tanto el mínimo es y se alcanza en .

(c) Con logaritmo natural, nats, es decir una perplejidad : como si el modelo perfecto dudara entre unas cinco continuaciones equiprobables. El riesgo 0-1 es 0.58 y solo mira el argmax: un modelo que pone 0.99 en "tejado" y otro que pone 0.42 tienen el mismo riesgo 0-1 y log-loss muy distintas. Un LLM se entrena y se evalúa con log-loss porque lo que usa es la distribución completa (muestreo, temperatura, calibración), así que su piso es la entropía, no el 0.58. M14 retoma esto.

Autoevaluación

Fuentes

Lo que queda fuera

Este módulo adapta material de MIT OpenCourseWare bajo licencia CC BY-NC-SA 4.0: MIT 18.657 Mathematics of Machine Learning (2015); MIT 6.7960 Deep Learning (2024). Las adaptaciones (traducción, figuras, simuladores) son propias y heredan la misma licencia. Enlaces a cada fuente en la sección Fuentes.

Siguiente
M02 · ¿Cuántos ejemplos necesito para confiar en mi eval de agentes?