Nunziati, Carlotta
(2026)
Neural Network Approaches to Italian Syllabification and Poetic Scansion for Italian Verse.
[Laurea magistrale], Università di Bologna, Corso di Studio in
Informatica [LM-DM270], Documento full-text non disponibile
Il full-text non è disponibile per scelta dell'autore.
(
Contatta l'autore)
Abstract
L'identificazione automatica dei confini sillabici e della posizione dell'accento rappresenta ancora oggi una sfida aperta per la lingua italiana a causa dell'ambiguità dei nessi vocalici, dell'interazione tra struttura sillabica e prosodia e della limitata disponibilità di risorse annotate. Per colmare questa lacuna, la tesi introduce Stylla, il primo dataset pubblico su larga scala per la sillabazione e la previsione dell'accento prosodico in italiano, costituito da circa 93.000 forme lessicali annotate. Il lavoro studia la capacità dei modelli neurali di apprendere e generalizzare tali fenomeni, formulando il problema come sequence labeling a livello di carattere e confrontando le architetture BiLSTM e Transformer.
Lo studio estende tali modelli alla scansione metrica della poesia italiana, un contesto in cui la struttura sillabica è influenzata da fenomeni fonologici e metrici quali sinalefe, dialefe, sineresi e dieresi. Gli esperimenti sono condotti sulla Divina Commedia di Dante Alighieri, utilizzando Inferno e Purgatorio per l’addestramento e Paradiso per la valutazione, al fine di verificare la capacità dei modelli di generalizzare su versi poetici non osservati.
A tal fine vengono confrontate quattro strategie: l'applicazione diretta dei modelli lessicali al testo poetico, l'integrazione di vincoli metrici espliciti, il fine-tuning supervisionato su corpora poetici annotati e un approccio di constrained decoding basato su beam search. I risultati mostrano che la sola sillabazione lessicale non è sufficiente a ricostruire correttamente la struttura metrica del verso, mentre l’introduzione di vincoli metrici migliora sensibilmente le prestazioni. Il fine-tuning supervisionato ottiene le migliori performance, ulteriormente migliorate dall’integrazione del constrained decoding, che impone vincoli strutturali globali in fase di decodifica.
Abstract
L'identificazione automatica dei confini sillabici e della posizione dell'accento rappresenta ancora oggi una sfida aperta per la lingua italiana a causa dell'ambiguità dei nessi vocalici, dell'interazione tra struttura sillabica e prosodia e della limitata disponibilità di risorse annotate. Per colmare questa lacuna, la tesi introduce Stylla, il primo dataset pubblico su larga scala per la sillabazione e la previsione dell'accento prosodico in italiano, costituito da circa 93.000 forme lessicali annotate. Il lavoro studia la capacità dei modelli neurali di apprendere e generalizzare tali fenomeni, formulando il problema come sequence labeling a livello di carattere e confrontando le architetture BiLSTM e Transformer.
Lo studio estende tali modelli alla scansione metrica della poesia italiana, un contesto in cui la struttura sillabica è influenzata da fenomeni fonologici e metrici quali sinalefe, dialefe, sineresi e dieresi. Gli esperimenti sono condotti sulla Divina Commedia di Dante Alighieri, utilizzando Inferno e Purgatorio per l’addestramento e Paradiso per la valutazione, al fine di verificare la capacità dei modelli di generalizzare su versi poetici non osservati.
A tal fine vengono confrontate quattro strategie: l'applicazione diretta dei modelli lessicali al testo poetico, l'integrazione di vincoli metrici espliciti, il fine-tuning supervisionato su corpora poetici annotati e un approccio di constrained decoding basato su beam search. I risultati mostrano che la sola sillabazione lessicale non è sufficiente a ricostruire correttamente la struttura metrica del verso, mentre l’introduzione di vincoli metrici migliora sensibilmente le prestazioni. Il fine-tuning supervisionato ottiene le migliori performance, ulteriormente migliorate dall’integrazione del constrained decoding, che impone vincoli strutturali globali in fase di decodifica.
Tipologia del documento
Tesi di laurea
(Laurea magistrale)
Autore della tesi
Nunziati, Carlotta
Relatore della tesi
Correlatore della tesi
Scuola
Corso di studio
Indirizzo
Curriculum B: Informatica per il management
Ordinamento Cds
DM270
Parole chiave
NLP,Syllabification,Stress Prediction,Sequence Labeling,Neural Networks,Computational Phonology,Metrical Scansion
Data di discussione della Tesi
16 Luglio 2026
URI
Altri metadati
Tipologia del documento
Tesi di laurea
(NON SPECIFICATO)
Autore della tesi
Nunziati, Carlotta
Relatore della tesi
Correlatore della tesi
Scuola
Corso di studio
Indirizzo
Curriculum B: Informatica per il management
Ordinamento Cds
DM270
Parole chiave
NLP,Syllabification,Stress Prediction,Sequence Labeling,Neural Networks,Computational Phonology,Metrical Scansion
Data di discussione della Tesi
16 Luglio 2026
URI
Gestione del documento: