Ban, Niccolò
(2026)
A thermodynamic modeling
of transformers.
[Laurea], Università di Bologna, Corso di Studio in
Fisica [L-DM270], Documento full-text non disponibile
Il full-text non è disponibile per scelta dell'autore.
(
Contatta l'autore)
Abstract
In questo lavoro diamo una breve introduzione all’algoritmo di deep learning, illustrando dapprima i concetti fondamentali delle reti neurali—la loro architettura
a strati, il processo di ottimizzazione tramite discesa del gradiente e le principali
strategie di regolarizzazione—per poi concentrarci sull’architettura Transformer e sul
meccanismo di attenzione che ne costituisce il nucleo. Seguendo un’analogia termodinamica, definiamo una temperatura di equilibrio basata sulla norma del gradiente
della loss, interpretando i parametri del modello come particelle di un sistema fisico
all’equilibrio. Applichiamo questa definizione a un Transformer encoder-decoder addestrato per la traduzione inglese-italiano, calcolando la temperatura delle singole
head di attenzione nelle matrici dei pesi di ciascun layer. I risultati mostrano un
chiaro andamento decrescente della temperatura con la profondità del layer, che
rende difficile isolare l’effetto della temperatura da quello della profondità stessa
negli esperimenti di pruning. Confrontando le prestazioni del modello dopo la rimozione delle head più calde e più fredde emergono risultati non conclusivi, ma
consistenti con la letteratura.
Abstract
In questo lavoro diamo una breve introduzione all’algoritmo di deep learning, illustrando dapprima i concetti fondamentali delle reti neurali—la loro architettura
a strati, il processo di ottimizzazione tramite discesa del gradiente e le principali
strategie di regolarizzazione—per poi concentrarci sull’architettura Transformer e sul
meccanismo di attenzione che ne costituisce il nucleo. Seguendo un’analogia termodinamica, definiamo una temperatura di equilibrio basata sulla norma del gradiente
della loss, interpretando i parametri del modello come particelle di un sistema fisico
all’equilibrio. Applichiamo questa definizione a un Transformer encoder-decoder addestrato per la traduzione inglese-italiano, calcolando la temperatura delle singole
head di attenzione nelle matrici dei pesi di ciascun layer. I risultati mostrano un
chiaro andamento decrescente della temperatura con la profondità del layer, che
rende difficile isolare l’effetto della temperatura da quello della profondità stessa
negli esperimenti di pruning. Confrontando le prestazioni del modello dopo la rimozione delle head più calde e più fredde emergono risultati non conclusivi, ma
consistenti con la letteratura.
Tipologia del documento
Tesi di laurea
(Laurea)
Autore della tesi
Ban, Niccolò
Relatore della tesi
Correlatore della tesi
Scuola
Corso di studio
Ordinamento Cds
DM270
Parole chiave
AI,Machine Learning,Deep Learning,Transformer,Attention
Data di discussione della Tesi
27 Luglio 2026
URI
Altri metadati
Tipologia del documento
Tesi di laurea
(NON SPECIFICATO)
Autore della tesi
Ban, Niccolò
Relatore della tesi
Correlatore della tesi
Scuola
Corso di studio
Ordinamento Cds
DM270
Parole chiave
AI,Machine Learning,Deep Learning,Transformer,Attention
Data di discussione della Tesi
27 Luglio 2026
URI
Gestione del documento: