The proposed thesis project focuses on the study of Explainable Artificial Intelligence (XAI) techniques applied to the interpretation of classification models based on pre-trained neural networks for natural language. The objective of the project is to analyze to what extent interpretable models, such as decision trees or small tree ensembles, can approximate the behavior of complex classifiers treated as black-boxes. In particular, the work involves the use of BERT-like pre-trained language models, available in literature and via open-source libraries, upon which interpretable surrogate models will be constructed. The core idea is to verify whether these surrogate models are capable of describing the behavior of the original classifier in a readable and understandable manner, while maintaining a high level of fidelity relative to its predictions.

L’attività di tesi proposta riguarda lo studio di tecniche di Explainable Artificial Intelligence (XAI) applicate all’interpretazione di modelli di classificazione basati su reti neurali preaddestrate per il linguaggio naturale. L’obiettivo del progetto è analizzare in che misura modelli interpretabili, quali alberi decisionali o piccoli ensemble di alberi, possano approssimare il comportamento di classificatori complessi trattati come black-box. In particolare, il lavoro prevede l’utilizzo di modelli linguistici preaddestrati di tipo BERT-like, già disponibili in letteratura e tramite librerie open source, sui quali verranno costruiti modelli surrogati interpretabili. L’idea è verificare se tali modelli surrogati siano in grado di descrivere in modo leggibile e comprensibile il comportamento del classificatore originale, mantenendo un buon livello di fedeltà rispetto alle sue predizioni.

Studio di modelli surrogati interpretabili per l’analisi di classificatori linguistici black-box

NALOTTO, GIACOMO
2025/2026

Abstract

The proposed thesis project focuses on the study of Explainable Artificial Intelligence (XAI) techniques applied to the interpretation of classification models based on pre-trained neural networks for natural language. The objective of the project is to analyze to what extent interpretable models, such as decision trees or small tree ensembles, can approximate the behavior of complex classifiers treated as black-boxes. In particular, the work involves the use of BERT-like pre-trained language models, available in literature and via open-source libraries, upon which interpretable surrogate models will be constructed. The core idea is to verify whether these surrogate models are capable of describing the behavior of the original classifier in a readable and understandable manner, while maintaining a high level of fidelity relative to its predictions.
2025
Interpretable Surrogate Models for the Analysis of Black-Box Language Models
L’attività di tesi proposta riguarda lo studio di tecniche di Explainable Artificial Intelligence (XAI) applicate all’interpretazione di modelli di classificazione basati su reti neurali preaddestrate per il linguaggio naturale. L’obiettivo del progetto è analizzare in che misura modelli interpretabili, quali alberi decisionali o piccoli ensemble di alberi, possano approssimare il comportamento di classificatori complessi trattati come black-box. In particolare, il lavoro prevede l’utilizzo di modelli linguistici preaddestrati di tipo BERT-like, già disponibili in letteratura e tramite librerie open source, sui quali verranno costruiti modelli surrogati interpretabili. L’idea è verificare se tali modelli surrogati siano in grado di descrivere in modo leggibile e comprensibile il comportamento del classificatore originale, mantenendo un buon livello di fedeltà rispetto alle sue predizioni.
XAI
Modelli surrogati
Black-box
Alberi decisionali
File in questo prodotto:
File Dimensione Formato  
Nalotto_Giacomo.pdf

accesso aperto

Dimensione 2 MB
Formato Adobe PDF
2 MB Adobe PDF Visualizza/Apri

The text of this website © Università degli studi di Padova. Full Text are published under a non-exclusive license. Metadata are under a CC0 License

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.12608/111053