Il presente lavoro di tesi illustra la progettazione e lo sviluppo di un'architettura backend ad alte prestazioni per un servizio di trascrizione Speech-to-Text. L'obiettivo principale è la realizzazione di un server intermedio (Proxy Server) capace di gestire in modo sicuro ed efficiente le comunicazioni tra gli utenti e un motore di inferenza basato su modelli di intelligenza artificiale (famiglia Whisper su server vLLM). Il sistema è stato specificamente ingegnerizzato per elaborare file multimediali di grandi dimensioni in totale sicurezza. Per superare i limiti fisici dell'hardware, come l'esaurimento della memoria video, e prevenire il degrado qualitativo delle trascrizioni su audio molto lunghi, è stata implementata una strategia di Smart Chunking. Questo sistema pre-analizza il flusso multimediale e lo suddivide in segmenti più brevi, effettuando i tagli esclusivamente in corrispondenza dei silenzi naturali. Questa metodologia assicura un consumo di risorse stabile e preserva il significato e il contesto delle frasi. A garanzia della robustezza del servizio, l'architettura integra diverse funzionalità avanzate. Il sistema si avvale innanzitutto di un'orchestrazione asincrona per gestire in parallelo l'elaborazione dei vari frammenti audio, ottimizzando così i tempi complessivi ed evitando la saturazione della rete. Successivamente, un algoritmo dedicato alla ricostruzione temporale si occupa di ricomporre accuratamente i testi trascritti, ricalcolando i riferimenti temporali per ripristinare l'esatta continuità cronologica del file originale. Infine, sul piano della resilienza e della sicurezza, l'infrastruttura protegge i dati degli utenti all'interno di ambienti isolati e implementa una tolleranza parziale agli errori; in questo modo, l'eventuale corruzione di un singolo frammento audio non interrompe l'intero processo, ma consente comunque la restituzione di tutta la parte di lavoro completata con successo fino a quel momento. L'intera architettura è stata rigorosamente validata attraverso test automatici su larga scala e collaudi su infrastrutture GPU reali. I risultati confermano l'efficacia della soluzione nel coordinare trascrizioni complesse e di lunga durata, garantendo un'elevata scalabilità e un'assoluta stabilità operativa.

Progettazione ed implementazione di un sistema Speech-to-Text con Smart Chunking

BRUNO, MARCO
2025/2026

Abstract

Il presente lavoro di tesi illustra la progettazione e lo sviluppo di un'architettura backend ad alte prestazioni per un servizio di trascrizione Speech-to-Text. L'obiettivo principale è la realizzazione di un server intermedio (Proxy Server) capace di gestire in modo sicuro ed efficiente le comunicazioni tra gli utenti e un motore di inferenza basato su modelli di intelligenza artificiale (famiglia Whisper su server vLLM). Il sistema è stato specificamente ingegnerizzato per elaborare file multimediali di grandi dimensioni in totale sicurezza. Per superare i limiti fisici dell'hardware, come l'esaurimento della memoria video, e prevenire il degrado qualitativo delle trascrizioni su audio molto lunghi, è stata implementata una strategia di Smart Chunking. Questo sistema pre-analizza il flusso multimediale e lo suddivide in segmenti più brevi, effettuando i tagli esclusivamente in corrispondenza dei silenzi naturali. Questa metodologia assicura un consumo di risorse stabile e preserva il significato e il contesto delle frasi. A garanzia della robustezza del servizio, l'architettura integra diverse funzionalità avanzate. Il sistema si avvale innanzitutto di un'orchestrazione asincrona per gestire in parallelo l'elaborazione dei vari frammenti audio, ottimizzando così i tempi complessivi ed evitando la saturazione della rete. Successivamente, un algoritmo dedicato alla ricostruzione temporale si occupa di ricomporre accuratamente i testi trascritti, ricalcolando i riferimenti temporali per ripristinare l'esatta continuità cronologica del file originale. Infine, sul piano della resilienza e della sicurezza, l'infrastruttura protegge i dati degli utenti all'interno di ambienti isolati e implementa una tolleranza parziale agli errori; in questo modo, l'eventuale corruzione di un singolo frammento audio non interrompe l'intero processo, ma consente comunque la restituzione di tutta la parte di lavoro completata con successo fino a quel momento. L'intera architettura è stata rigorosamente validata attraverso test automatici su larga scala e collaudi su infrastrutture GPU reali. I risultati confermano l'efficacia della soluzione nel coordinare trascrizioni complesse e di lunga durata, garantendo un'elevata scalabilità e un'assoluta stabilità operativa.
2025
Design and implementation of a Speech-to-Text system with Smart Chunking
speech to text
Smart Chunking
REST API
File in questo prodotto:
File Dimensione Formato  
Bruno_Marco.pdf

accesso aperto

Dimensione 649.01 kB
Formato Adobe PDF
649.01 kB Adobe PDF Visualizza/Apri

The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.12608/111140