Il presente lavoro di tesi illustra la progettazione e lo sviluppo di un'architettura backend ad alte prestazioni per un servizio di trascrizione Speech-to-Text. L'obiettivo principale è la realizzazione di un server intermedio (Proxy Server) capace di gestire in modo sicuro ed efficiente le comunicazioni tra gli utenti e un motore di inferenza basato su modelli di intelligenza artificiale (famiglia Whisper su server vLLM). Il sistema è stato specificamente ingegnerizzato per elaborare file multimediali di grandi dimensioni in totale sicurezza. Per superare i limiti fisici dell'hardware, come l'esaurimento della memoria video, e prevenire il degrado qualitativo delle trascrizioni su audio molto lunghi, è stata implementata una strategia di Smart Chunking. Questo sistema pre-analizza il flusso multimediale e lo suddivide in segmenti più brevi, effettuando i tagli esclusivamente in corrispondenza dei silenzi naturali. Questa metodologia assicura un consumo di risorse stabile e preserva il significato e il contesto delle frasi. A garanzia della robustezza del servizio, l'architettura integra diverse funzionalità avanzate. Il sistema si avvale innanzitutto di un'orchestrazione asincrona per gestire in parallelo l'elaborazione dei vari frammenti audio, ottimizzando così i tempi complessivi ed evitando la saturazione della rete. Successivamente, un algoritmo dedicato alla ricostruzione temporale si occupa di ricomporre accuratamente i testi trascritti, ricalcolando i riferimenti temporali per ripristinare l'esatta continuità cronologica del file originale. Infine, sul piano della resilienza e della sicurezza, l'infrastruttura protegge i dati degli utenti all'interno di ambienti isolati e implementa una tolleranza parziale agli errori; in questo modo, l'eventuale corruzione di un singolo frammento audio non interrompe l'intero processo, ma consente comunque la restituzione di tutta la parte di lavoro completata con successo fino a quel momento. L'intera architettura è stata rigorosamente validata attraverso test automatici su larga scala e collaudi su infrastrutture GPU reali. I risultati confermano l'efficacia della soluzione nel coordinare trascrizioni complesse e di lunga durata, garantendo un'elevata scalabilità e un'assoluta stabilità operativa.
Progettazione ed implementazione di un sistema Speech-to-Text con Smart Chunking
BRUNO, MARCO
2025/2026
Abstract
Il presente lavoro di tesi illustra la progettazione e lo sviluppo di un'architettura backend ad alte prestazioni per un servizio di trascrizione Speech-to-Text. L'obiettivo principale è la realizzazione di un server intermedio (Proxy Server) capace di gestire in modo sicuro ed efficiente le comunicazioni tra gli utenti e un motore di inferenza basato su modelli di intelligenza artificiale (famiglia Whisper su server vLLM). Il sistema è stato specificamente ingegnerizzato per elaborare file multimediali di grandi dimensioni in totale sicurezza. Per superare i limiti fisici dell'hardware, come l'esaurimento della memoria video, e prevenire il degrado qualitativo delle trascrizioni su audio molto lunghi, è stata implementata una strategia di Smart Chunking. Questo sistema pre-analizza il flusso multimediale e lo suddivide in segmenti più brevi, effettuando i tagli esclusivamente in corrispondenza dei silenzi naturali. Questa metodologia assicura un consumo di risorse stabile e preserva il significato e il contesto delle frasi. A garanzia della robustezza del servizio, l'architettura integra diverse funzionalità avanzate. Il sistema si avvale innanzitutto di un'orchestrazione asincrona per gestire in parallelo l'elaborazione dei vari frammenti audio, ottimizzando così i tempi complessivi ed evitando la saturazione della rete. Successivamente, un algoritmo dedicato alla ricostruzione temporale si occupa di ricomporre accuratamente i testi trascritti, ricalcolando i riferimenti temporali per ripristinare l'esatta continuità cronologica del file originale. Infine, sul piano della resilienza e della sicurezza, l'infrastruttura protegge i dati degli utenti all'interno di ambienti isolati e implementa una tolleranza parziale agli errori; in questo modo, l'eventuale corruzione di un singolo frammento audio non interrompe l'intero processo, ma consente comunque la restituzione di tutta la parte di lavoro completata con successo fino a quel momento. L'intera architettura è stata rigorosamente validata attraverso test automatici su larga scala e collaudi su infrastrutture GPU reali. I risultati confermano l'efficacia della soluzione nel coordinare trascrizioni complesse e di lunga durata, garantendo un'elevata scalabilità e un'assoluta stabilità operativa.| File | Dimensione | Formato | |
|---|---|---|---|
|
Bruno_Marco.pdf
accesso aperto
Dimensione
649.01 kB
Formato
Adobe PDF
|
649.01 kB | Adobe PDF | Visualizza/Apri |
The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License
https://hdl.handle.net/20.500.12608/111140