L'integrazione dei Vision-Language Models (VLM) nei sistemi autonomi e nella robotica manipolativa assume un'importanza fondamentale per lo sviluppo di comportamenti intelligenti. Tuttavia, l'impiego di queste tecnologie si scontra con sfide significative dovute ai limiti intrinseci delle architetture basate su un unico modello isolato, quali la fragilità nel ragionamento sequenziale e la tendenza a generare allucinazioni visive. Questo lavoro di tesi si concentra sull'ottimizzazione di sistemi che, superando l'approccio a singolo agente, coordinano un'architettura multi-modello composta da diversi sotto-modelli specializzati. L'obiettivo è l'estensione e l'ottimizzazione di un framework preesistente per renderlo in grado di supportare la collaborazione tra i diversi modelli, migliorando la robustezza e la cooperazione del collettivo di agenti senza richiederne un ulteriore addestramento (fine-tuning). A tal fine, lo sviluppo e la validazione iniziale del sistema sono stati condotti interfacciando vari modelli allo stato dell'arte (famiglie Gemma e Gemini di Google DeepMind) per l'esecuzione di molteplici compiti, tra cui l'elaborazione delle immagini, la comprensione del contesto e degli oggetti di interesse, e l'inferenza delle relazioni di causa-effetto. Il sistema è stato testato per lo svolgimento di task manipolativi ispirati a scenari domestici quotidiani; più precisamente, la sperimentazione è stata condotta all'interno dell'ambiente di simulazione standardizzato KinDER. L'analisi sperimentale quantitativa ha confermato la robustezza del paradigma proposto, evidenziando un netto trade-off prestazionale tra l'impiego di servizi remoti in Cloud e l'inferenza locale: mentre le API remote garantiscono un'infallibilità logica a fronte di elevate latenze, i modelli locali assicurano tempistiche deterministiche, compensando le vulnerabilità native proprio grazie ai meccanismi di correzione iterativa garantiti dall'architettura multi-agente.
Design di un’architettura multi-modello per la robotica in ambienti domestici
MOGENTALE, GIOVANNI
2025/2026
Abstract
L'integrazione dei Vision-Language Models (VLM) nei sistemi autonomi e nella robotica manipolativa assume un'importanza fondamentale per lo sviluppo di comportamenti intelligenti. Tuttavia, l'impiego di queste tecnologie si scontra con sfide significative dovute ai limiti intrinseci delle architetture basate su un unico modello isolato, quali la fragilità nel ragionamento sequenziale e la tendenza a generare allucinazioni visive. Questo lavoro di tesi si concentra sull'ottimizzazione di sistemi che, superando l'approccio a singolo agente, coordinano un'architettura multi-modello composta da diversi sotto-modelli specializzati. L'obiettivo è l'estensione e l'ottimizzazione di un framework preesistente per renderlo in grado di supportare la collaborazione tra i diversi modelli, migliorando la robustezza e la cooperazione del collettivo di agenti senza richiederne un ulteriore addestramento (fine-tuning). A tal fine, lo sviluppo e la validazione iniziale del sistema sono stati condotti interfacciando vari modelli allo stato dell'arte (famiglie Gemma e Gemini di Google DeepMind) per l'esecuzione di molteplici compiti, tra cui l'elaborazione delle immagini, la comprensione del contesto e degli oggetti di interesse, e l'inferenza delle relazioni di causa-effetto. Il sistema è stato testato per lo svolgimento di task manipolativi ispirati a scenari domestici quotidiani; più precisamente, la sperimentazione è stata condotta all'interno dell'ambiente di simulazione standardizzato KinDER. L'analisi sperimentale quantitativa ha confermato la robustezza del paradigma proposto, evidenziando un netto trade-off prestazionale tra l'impiego di servizi remoti in Cloud e l'inferenza locale: mentre le API remote garantiscono un'infallibilità logica a fronte di elevate latenze, i modelli locali assicurano tempistiche deterministiche, compensando le vulnerabilità native proprio grazie ai meccanismi di correzione iterativa garantiti dall'architettura multi-agente.| File | Dimensione | Formato | |
|---|---|---|---|
|
Mogentale_Giovanni.pdf
Accesso riservato
Dimensione
1.76 MB
Formato
Adobe PDF
|
1.76 MB | Adobe PDF |
The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License
https://hdl.handle.net/20.500.12608/114275