Dimensional emotion analysis along continuous valence and arousal dimensions offers a richer representation of human affect in comparison to categorical approaches, although robust regression models remain scarce across modalities and languages. In this thesis, I present a unified regression framework trained on 50 publicly available datasets, comprising approximately 3.6 million samples across 49 languages and multiple modalities (texts, images, and image-text pairs). I adapt BEiT-3 as a backbone encoder for my regressor, using a dual-branch regression head and a generalizable cross-lingual embedding alignment strategy. Moreover, I integrate Adaptive Optimal Transport-based Conformal Prediction (OT-CP+) to produce well-calibrated uncertainty estimates. My model achieves strong predictive performance across modalities and languages, evaluating its zero-shot capabilities under distribution shifts while strictly satisfying nominal coverage guarantees for predictive trustworthiness.
L'analisi dimensionale delle emozioni lungo le dimensioni continue di valenza e arousal offre una rappresentazione più ricca dell'affettività umana rispetto agli approcci categoriali, sebbene i modelli di regressione robusti rimangano ancora poco diffusi tra diverse modalità e lingue. In questa tesi, presento un framework unificato di regressione addestrato su 50 dataset pubblicamente disponibili, comprendenti circa 3,6 milioni di campioni distribuiti su 49 lingue e diverse modalità (testi, immagini e coppie immagine-testo). Adatto BEiT-3 come encoder di base per il mio regressore, utilizzando una testa di regressione a doppio ramo e una strategia generalizzabile di allineamento cross-linguale degli embedding. Inoltre, integro Adaptive Optimal Transport-based Conformal Prediction (OT-CP+) per produrre stime dell'incertezza ben calibrate. Il mio modello raggiunge prestazioni predittive elevate tra diverse modalità e lingue, valutando le sue capacità zero-shot in presenza di cambiamenti nella distribuzione dei dati e garantendo al contempo il rispetto rigoroso delle garanzie nominali di copertura, a supporto dell'affidabilità delle predizioni.
Riconoscimento delle emozioni in contenuti multimodali tramite modelli di visione e linguaggio su larga scala
D'ALTERIO GRAZIOLI, MANUEL
2025/2026
Abstract
Dimensional emotion analysis along continuous valence and arousal dimensions offers a richer representation of human affect in comparison to categorical approaches, although robust regression models remain scarce across modalities and languages. In this thesis, I present a unified regression framework trained on 50 publicly available datasets, comprising approximately 3.6 million samples across 49 languages and multiple modalities (texts, images, and image-text pairs). I adapt BEiT-3 as a backbone encoder for my regressor, using a dual-branch regression head and a generalizable cross-lingual embedding alignment strategy. Moreover, I integrate Adaptive Optimal Transport-based Conformal Prediction (OT-CP+) to produce well-calibrated uncertainty estimates. My model achieves strong predictive performance across modalities and languages, evaluating its zero-shot capabilities under distribution shifts while strictly satisfying nominal coverage guarantees for predictive trustworthiness.| File | Dimensione | Formato | |
|---|---|---|---|
|
D_Alterio_Grazioli_thesis.pdf
Accesso riservato
Dimensione
9.72 MB
Formato
Adobe PDF
|
9.72 MB | Adobe PDF |
The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License
https://hdl.handle.net/20.500.12608/115865