Fra ordine e disordine: proprietà statistiche del linguaggio generato da Large Language Model

Zurlo, Samuele (2026) Fra ordine e disordine: proprietà statistiche del linguaggio generato da Large Language Model. [Laurea], Università di Bologna, Corso di Studio in Fisica [L-DM270], Documento ad accesso riservato.
Documenti full-text disponibili:
[thumbnail of Thesis] Documento PDF (Thesis)
Full-text non accessibile fino al 1 Dicembre 2026.
Disponibile con Licenza: Creative Commons: Attribuzione - Non commerciale - Condividi allo stesso modo 4.0 (CC BY-NC-SA 4.0)

Download (9MB) | Contatta l'autore

Abstract

Il linguaggio naturale esibisce regolarità statistiche che nessuna grammatica prescrive: leggi di scala del vocabolario e correlazioni che decadono a legge di potenza su scale molto maggiori della frase. Un modello linguistico produce successioni di simboli che a prima vista le riproducono. La tesi chiede quali riproduca effettivamente, e a quale livello della gerarchia linguistica smetta di riprodurle. Il primo asse di analisi è la temperatura di campionamento. Cinque modelli Qwen generano 242 documenti a dodici temperature. Otto criteri tratti da quattro lavori indipendenti danno una mediana identica T = 1.0 per tutti i modelli, senza dipendenza dalla dimensione; la finestra è però stretta, e fuori da essa il testo degenera per ripetizione o per incoerenza, con soli due documenti su 242 non degenerati. I criteri che convergono sono tutti definiti sui conteggi o sui caratteri. Il secondo asse è la gerarchia dei livelli linguistici, su un corpus in cui la qualità del testo non è una variabile: 39 voci appaiate per titolo fra Wikipedia e Grokipedia, con Guerra e pace come riferimento letterario. Il testo generato conserva il meccanismo descritto da Altmann, Cristadoro e Degli Esposti (PNAS 2012) e ne riduce l'ampiezza. Sulle lettere i corpora sono indistinguibili; il divario si apre al livello delle parole, dove supera di un ordine di grandezza quello misurato sui caratteri, senza però separare le parole di contenuto dai controlli a frequenza appaiata. Sul piano del metodo, l'esponente di coda e il cut-off della distribuzione degli intervalli, assunti nel lavoro di riferimento, sono stimati per massima verosimiglianza, e viene introdotta un'entropia degli intervalli invariante per dilatazione dell'asse dei tempi, con cui il divario è confermato a −0.105 bit.

Abstract
Tipologia del documento
Tesi di laurea (Laurea)
Autore della tesi
Zurlo, Samuele
Relatore della tesi
Scuola
Corso di studio
Ordinamento Cds
DM270
Parole chiave
sistemi complessi,llm,burstiness,zipf,heaps,dfa,qwen,correlazioni a lungo raggio,transizione di fase,wikipedia,linguaggio naturale,grokipedia,teoria dell'informazione,entropia
Data di discussione della Tesi
17 Settembre 2026
URI

Altri metadati

Gestione del documento: Visualizza il documento

^