Zurlo, Samuele
(2026)
Fra ordine e disordine: proprietà statistiche del linguaggio generato da Large Language Model.
[Laurea], Università di Bologna, Corso di Studio in
Fisica [L-DM270], Documento ad accesso riservato.
Documenti full-text disponibili:
Abstract
Il linguaggio naturale esibisce regolarità statistiche che nessuna grammatica prescrive: leggi di scala del vocabolario e correlazioni che decadono a legge di potenza su scale molto maggiori della frase. Un modello linguistico produce successioni di simboli che a prima vista le riproducono. La tesi chiede quali riproduca effettivamente, e a quale livello della gerarchia linguistica smetta di riprodurle.
Il primo asse di analisi è la temperatura di campionamento. Cinque modelli Qwen generano 242 documenti a dodici temperature. Otto criteri tratti da quattro lavori indipendenti danno una mediana identica T = 1.0 per tutti i modelli, senza dipendenza dalla dimensione; la finestra è però stretta, e fuori da essa il testo degenera per ripetizione o per incoerenza, con soli due documenti su 242 non degenerati. I criteri che convergono sono tutti definiti sui conteggi o sui caratteri.
Il secondo asse è la gerarchia dei livelli linguistici, su un corpus in cui la qualità del testo non è una variabile: 39 voci appaiate per titolo fra Wikipedia e Grokipedia, con Guerra e pace come riferimento letterario. Il testo generato conserva il meccanismo descritto da Altmann, Cristadoro e Degli Esposti (PNAS 2012) e ne riduce l'ampiezza. Sulle lettere i corpora sono indistinguibili; il divario si apre al livello delle parole, dove supera di un ordine di grandezza quello misurato sui caratteri, senza però separare le parole di contenuto dai controlli a frequenza appaiata.
Sul piano del metodo, l'esponente di coda e il cut-off della distribuzione degli intervalli, assunti nel lavoro di riferimento, sono stimati per massima verosimiglianza, e viene introdotta un'entropia degli intervalli invariante per dilatazione dell'asse dei tempi, con cui il divario è confermato a −0.105 bit.
Abstract
Il linguaggio naturale esibisce regolarità statistiche che nessuna grammatica prescrive: leggi di scala del vocabolario e correlazioni che decadono a legge di potenza su scale molto maggiori della frase. Un modello linguistico produce successioni di simboli che a prima vista le riproducono. La tesi chiede quali riproduca effettivamente, e a quale livello della gerarchia linguistica smetta di riprodurle.
Il primo asse di analisi è la temperatura di campionamento. Cinque modelli Qwen generano 242 documenti a dodici temperature. Otto criteri tratti da quattro lavori indipendenti danno una mediana identica T = 1.0 per tutti i modelli, senza dipendenza dalla dimensione; la finestra è però stretta, e fuori da essa il testo degenera per ripetizione o per incoerenza, con soli due documenti su 242 non degenerati. I criteri che convergono sono tutti definiti sui conteggi o sui caratteri.
Il secondo asse è la gerarchia dei livelli linguistici, su un corpus in cui la qualità del testo non è una variabile: 39 voci appaiate per titolo fra Wikipedia e Grokipedia, con Guerra e pace come riferimento letterario. Il testo generato conserva il meccanismo descritto da Altmann, Cristadoro e Degli Esposti (PNAS 2012) e ne riduce l'ampiezza. Sulle lettere i corpora sono indistinguibili; il divario si apre al livello delle parole, dove supera di un ordine di grandezza quello misurato sui caratteri, senza però separare le parole di contenuto dai controlli a frequenza appaiata.
Sul piano del metodo, l'esponente di coda e il cut-off della distribuzione degli intervalli, assunti nel lavoro di riferimento, sono stimati per massima verosimiglianza, e viene introdotta un'entropia degli intervalli invariante per dilatazione dell'asse dei tempi, con cui il divario è confermato a −0.105 bit.
Tipologia del documento
Tesi di laurea
(Laurea)
Autore della tesi
Zurlo, Samuele
Relatore della tesi
Scuola
Corso di studio
Ordinamento Cds
DM270
Parole chiave
sistemi complessi,llm,burstiness,zipf,heaps,dfa,qwen,correlazioni a lungo raggio,transizione di fase,wikipedia,linguaggio naturale,grokipedia,teoria dell'informazione,entropia
Data di discussione della Tesi
17 Settembre 2026
URI
Altri metadati
Tipologia del documento
Tesi di laurea
(NON SPECIFICATO)
Autore della tesi
Zurlo, Samuele
Relatore della tesi
Scuola
Corso di studio
Ordinamento Cds
DM270
Parole chiave
sistemi complessi,llm,burstiness,zipf,heaps,dfa,qwen,correlazioni a lungo raggio,transizione di fase,wikipedia,linguaggio naturale,grokipedia,teoria dell'informazione,entropia
Data di discussione della Tesi
17 Settembre 2026
URI
Gestione del documento: