Aplicación de CALM Decoding para la generación eficiente y adaptativa en modelos delenguaje y razonamiento

Download PDF(1.49 MB)

Abstract

Un modelo de lenguaje genera texto palabra a palabra. En cada paso, una red neuronal con muchas capas calcula una distribución de probabilidad: estima qué palabras son más probables como continuación. Después selecciona una y repite el proceso. Recorrer todas las capas para calcular las probabilidades es costoso. En muchos casos, las capas intermedias del modelo ya producen distribuciones de probabilidad muy parecidas a las que se obtendrían en la capa final. Este TFG estudia cómo detectar ese momento mediante métricas de convergencia entre capas y un clasificador entrenado para decidir cuándo detener el cálculo, reduciendo el coste computacional de generación.
A language model generates text word by word. At each step, a neural network with many layers computes a probability distribution: it estimates which words are most likely to come next. It then selects one and repeats the process. Running through all the layers to compute these probabilities is costly. In many cases, the intermediate layers of the model already produce probability distributions very similar to those that would be obtained at the final layer. This thesis studies how to detect that moment using layer convergence metrics and a classifier trained to decide when to stop the computation, reducing the computational cost of generation.
Ítem

Información detallada

Materias, derechos, colecciones e identificadores

Keywords

KMI, salida anticipada; inferencia eficiente; modelos de lenguaje; distribución de probabilidad; convergencia de capas; logit lens; generación autoregresiva., early exit; efficient inference; language models; probability distribution; layer convergence; logit lens; autoregressive generation.

Rights

Attribution-NonCommercial-NoDerivs 3.0 United States