La crescente diffusione di tecniche di generazione e manipolazione automatica delle immagini pone sfide significative per l'affidabilità dei contenuti digitali condivisi sui social media. Questa tesi affronta il problema della classificazione binaria di immagini manipolate attraverso un confronto sistematico tra approcci supervisionati e non supervisionati, applicati a due sorgenti di feature di natura complementare: rappresentazioni semantiche estratte tramite Vision Transformer (DINOv2) e statistiche del dominio della frequenza ottenute mediante trasformata discreta del coseno (DCT). Lo studio è condotto sul dataset SID-Set, condotto sul dataset SID-Set, presentato insieme a SIDA (Social media Image Detection, localization and explanation Assistant), un sistema per la detection, localizzazione e spiegazione di immagini deepfake, che offre un ampio insieme di immagini reali e manipolate rappresentative del contesto dei social media. Oltre al confronto isolato delle due modalità, viene valutato un approccio supervisionato basato sulla fusione delle feature ViT e DCT, al fine di verificarne la complementarità nel miglioramento delle prestazioni di rilevamento.

Image Forensics Ibrida :ViT, DCT e fusione a confronto, un'analisi comparativa supervisionata e non supervisionata

ZORZI, ISABELLA
2025/2026

Abstract

La crescente diffusione di tecniche di generazione e manipolazione automatica delle immagini pone sfide significative per l'affidabilità dei contenuti digitali condivisi sui social media. Questa tesi affronta il problema della classificazione binaria di immagini manipolate attraverso un confronto sistematico tra approcci supervisionati e non supervisionati, applicati a due sorgenti di feature di natura complementare: rappresentazioni semantiche estratte tramite Vision Transformer (DINOv2) e statistiche del dominio della frequenza ottenute mediante trasformata discreta del coseno (DCT). Lo studio è condotto sul dataset SID-Set, condotto sul dataset SID-Set, presentato insieme a SIDA (Social media Image Detection, localization and explanation Assistant), un sistema per la detection, localizzazione e spiegazione di immagini deepfake, che offre un ampio insieme di immagini reali e manipolate rappresentative del contesto dei social media. Oltre al confronto isolato delle due modalità, viene valutato un approccio supervisionato basato sulla fusione delle feature ViT e DCT, al fine di verificarne la complementarità nel miglioramento delle prestazioni di rilevamento.
2025
Hybrid Image Forensics: Comparing ViT, DCT, and Fusion, Supervised and Unsupervised Comparative Analysis
Image forensics
ViT,DC
Localizzazione
File in questo prodotto:
File Dimensione Formato  
Zorzi_Isabella.pdf

embargo fino al 23/09/2027

Dimensione 854.3 kB
Formato Adobe PDF
854.3 kB Adobe PDF

The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.12608/114271