Documenti full-text disponibili:
Abstract
La consultazione della documentazione scolastica risulta complessa per famiglie e personale a causa della frammentazione dei formati e dell'assenza di strumenti di ricerca semantica. Tale problematica è cruciale per la necessità di coniugare l'accessibilità dei dati all'efficienza amministrativa, rispettando al contempo stringenti vincoli di riservatezza. L'obiettivo della tesi è lo sviluppo di un sistema RAG (Retrieval-Augmented Generation) che garantisca accuratezza nelle risposte, protezione dei dati e misure di sicurezza preventive idonee per futuri sviluppi su documenti privati.
Il problema è stato affrontato progettando un'architettura interamente on-premises per garantire l'isolamento dei dati e selezionando modelli compatibili con le risorse hardware limitate della macchina di sviluppo. Le pipeline di ingestion e di chunking sono state perfezionate attraverso un processo iterativo di test empirici e ottimizzazioni continue sui risultati intermedi. Il contributo originale risiede proprio nell'ingegnerizzazione di queste pipeline OCR e di scomposizione semantica, calibrate per minimizzare gli errori di parsing strutturale e tabellare.
I risultati dimostrano la fattibilità di un modulo di caricamento accessibile che massimizza l'accuratezza estrattiva, unito a un'interfaccia di querying che formula risposte vincolate al contesto, cita le fonti ufficiali e rifiuta richieste inopportune grazie a logiche di controllo differenziate. Il lavoro è suddiviso in un'analisi iniziale dei requisiti e dei vincoli, una rassegna dello stato dell'arte e la definizione dell'architettura di sistema; vengono poi presentate le tecnologie utilizzate e i dettagli dell'implementazione software, concludendo con le considerazioni finali sugli obiettivi raggiunti.
Abstract
La consultazione della documentazione scolastica risulta complessa per famiglie e personale a causa della frammentazione dei formati e dell'assenza di strumenti di ricerca semantica. Tale problematica è cruciale per la necessità di coniugare l'accessibilità dei dati all'efficienza amministrativa, rispettando al contempo stringenti vincoli di riservatezza. L'obiettivo della tesi è lo sviluppo di un sistema RAG (Retrieval-Augmented Generation) che garantisca accuratezza nelle risposte, protezione dei dati e misure di sicurezza preventive idonee per futuri sviluppi su documenti privati.
Il problema è stato affrontato progettando un'architettura interamente on-premises per garantire l'isolamento dei dati e selezionando modelli compatibili con le risorse hardware limitate della macchina di sviluppo. Le pipeline di ingestion e di chunking sono state perfezionate attraverso un processo iterativo di test empirici e ottimizzazioni continue sui risultati intermedi. Il contributo originale risiede proprio nell'ingegnerizzazione di queste pipeline OCR e di scomposizione semantica, calibrate per minimizzare gli errori di parsing strutturale e tabellare.
I risultati dimostrano la fattibilità di un modulo di caricamento accessibile che massimizza l'accuratezza estrattiva, unito a un'interfaccia di querying che formula risposte vincolate al contesto, cita le fonti ufficiali e rifiuta richieste inopportune grazie a logiche di controllo differenziate. Il lavoro è suddiviso in un'analisi iniziale dei requisiti e dei vincoli, una rassegna dello stato dell'arte e la definizione dell'architettura di sistema; vengono poi presentate le tecnologie utilizzate e i dettagli dell'implementazione software, concludendo con le considerazioni finali sugli obiettivi raggiunti.
Tipologia del documento
Tesi di laurea
(Laurea)
Autore della tesi
Mantoni, Federico
Relatore della tesi
Scuola
Corso di studio
Ordinamento Cds
DM270
Parole chiave
Retrieval-Augmented Generation (RAG),Large Language Models,Vision-OCR multimodale,Ingestione documentale,privacy dei dati
Data di discussione della Tesi
16 Luglio 2026
URI
Altri metadati
Tipologia del documento
Tesi di laurea
(NON SPECIFICATO)
Autore della tesi
Mantoni, Federico
Relatore della tesi
Scuola
Corso di studio
Ordinamento Cds
DM270
Parole chiave
Retrieval-Augmented Generation (RAG),Large Language Models,Vision-OCR multimodale,Ingestione documentale,privacy dei dati
Data di discussione della Tesi
16 Luglio 2026
URI
Statistica sui download
Gestione del documento: