En base a mis conocimientos, el entrenamiento se basa en un proceso tremendamente masivo en términos de compute y de datos, en donde el modelo despliega un proceso de aprendizaje autosupervisado, intentanto predecir el texto que vendría después, dado un fragmento inicial.

Lo que se entrena es una red neuronal profunda, especificamente los pesos de la relación entre cada neurona. En el caso de los últimos modelos de lenguaje abiertos, sabemos que Llama 3.4 405B tiene, como su nombre lo indica, 405 miles de millones de parámetros, concepto equivalente a los pesos. Cada “run” de entrenamiento entrega un input al modelo y compara el resultado con el target, actualizando sus parámetros mediante retropropagación.

Algo nuevo que aprendí, sin embargo, en el episodio de Ezra Klein en donde entrevista a Uno de los co-fundadores de Anthropic, es que hubo un salto cualitativo en las capacidades de los modelos cuando empezaron a entrenarlos no sólo en base a la predicción de lenguaje, sino que también en función de resolución de problemas (por ejemplo, en planillas de cálculo), lo cual produjo los modelos de razonamiento.