The proposed thesis project focuses on the study of Explainable Artificial Intelligence (XAI) techniques applied to the interpretation of classification models based on pre-trained neural networks for natural language. The objective of the project is to analyze to what extent interpretable models, such as decision trees or small tree ensembles, can approximate the behavior of complex classifiers treated as black-boxes. In particular, the work involves the use of BERT-like pre-trained language models, available in literature and via open-source libraries, upon which interpretable surrogate models will be constructed. The core idea is to verify whether these surrogate models are capable of describing the behavior of the original classifier in a readable and understandable manner, while maintaining a high level of fidelity relative to its predictions.
L’attività di tesi proposta riguarda lo studio di tecniche di Explainable Artificial Intelligence (XAI) applicate all’interpretazione di modelli di classificazione basati su reti neurali preaddestrate per il linguaggio naturale. L’obiettivo del progetto è analizzare in che misura modelli interpretabili, quali alberi decisionali o piccoli ensemble di alberi, possano approssimare il comportamento di classificatori complessi trattati come black-box. In particolare, il lavoro prevede l’utilizzo di modelli linguistici preaddestrati di tipo BERT-like, già disponibili in letteratura e tramite librerie open source, sui quali verranno costruiti modelli surrogati interpretabili. L’idea è verificare se tali modelli surrogati siano in grado di descrivere in modo leggibile e comprensibile il comportamento del classificatore originale, mantenendo un buon livello di fedeltà rispetto alle sue predizioni.
Studio di modelli surrogati interpretabili per l’analisi di classificatori linguistici black-box
NALOTTO, GIACOMO
2025/2026
Abstract
The proposed thesis project focuses on the study of Explainable Artificial Intelligence (XAI) techniques applied to the interpretation of classification models based on pre-trained neural networks for natural language. The objective of the project is to analyze to what extent interpretable models, such as decision trees or small tree ensembles, can approximate the behavior of complex classifiers treated as black-boxes. In particular, the work involves the use of BERT-like pre-trained language models, available in literature and via open-source libraries, upon which interpretable surrogate models will be constructed. The core idea is to verify whether these surrogate models are capable of describing the behavior of the original classifier in a readable and understandable manner, while maintaining a high level of fidelity relative to its predictions.| File | Dimensione | Formato | |
|---|---|---|---|
|
Nalotto_Giacomo.pdf
accesso aperto
Dimensione
2 MB
Formato
Adobe PDF
|
2 MB | Adobe PDF | Visualizza/Apri |
The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License
https://hdl.handle.net/20.500.12608/111053