La crescente diffusione di tecniche di generazione e manipolazione automatica delle immagini pone sfide significative per l'affidabilità dei contenuti digitali condivisi sui social media. Questa tesi affronta il problema della classificazione binaria di immagini manipolate attraverso un confronto sistematico tra approcci supervisionati e non supervisionati, applicati a due sorgenti di feature di natura complementare: rappresentazioni semantiche estratte tramite Vision Transformer (DINOv2) e statistiche del dominio della frequenza ottenute mediante trasformata discreta del coseno (DCT). Lo studio è condotto sul dataset SID-Set, condotto sul dataset SID-Set, presentato insieme a SIDA (Social media Image Detection, localization and explanation Assistant), un sistema per la detection, localizzazione e spiegazione di immagini deepfake, che offre un ampio insieme di immagini reali e manipolate rappresentative del contesto dei social media. Oltre al confronto isolato delle due modalità, viene valutato un approccio supervisionato basato sulla fusione delle feature ViT e DCT, al fine di verificarne la complementarità nel miglioramento delle prestazioni di rilevamento.
Image Forensics Ibrida :ViT, DCT e fusione a confronto, un'analisi comparativa supervisionata e non supervisionata
ZORZI, ISABELLA
2025/2026
Abstract
La crescente diffusione di tecniche di generazione e manipolazione automatica delle immagini pone sfide significative per l'affidabilità dei contenuti digitali condivisi sui social media. Questa tesi affronta il problema della classificazione binaria di immagini manipolate attraverso un confronto sistematico tra approcci supervisionati e non supervisionati, applicati a due sorgenti di feature di natura complementare: rappresentazioni semantiche estratte tramite Vision Transformer (DINOv2) e statistiche del dominio della frequenza ottenute mediante trasformata discreta del coseno (DCT). Lo studio è condotto sul dataset SID-Set, condotto sul dataset SID-Set, presentato insieme a SIDA (Social media Image Detection, localization and explanation Assistant), un sistema per la detection, localizzazione e spiegazione di immagini deepfake, che offre un ampio insieme di immagini reali e manipolate rappresentative del contesto dei social media. Oltre al confronto isolato delle due modalità, viene valutato un approccio supervisionato basato sulla fusione delle feature ViT e DCT, al fine di verificarne la complementarità nel miglioramento delle prestazioni di rilevamento.| File | Dimensione | Formato | |
|---|---|---|---|
|
Zorzi_Isabella.pdf
embargo fino al 23/09/2027
Dimensione
854.3 kB
Formato
Adobe PDF
|
854.3 kB | Adobe PDF |
The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License
https://hdl.handle.net/20.500.12608/114271