Corso di Laurea Magistrale in Informatica
Appunti di Explainable And Trustworthy
AI
Anno Accademico 2025/2026
Studente: Emmanuel Messina
Politecnico Di Torino
Indice
1 Affidabilità AI 4
1.1 La Pervasività dei Modelli di Machine Learning e il Problema della Fiducia . . . . . 4
1.2 La Necessità di un’Intelligenza Artificiale Affidabile e i Suoi Requisiti . . . . . . . . . 10
1.3 Tassonomia . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
2 Pre-Modeling Explainability 30
2.1 Introduzione alla Explainability e le sue Fasi . . . . . . . . . . . . . . . . . . . . . . 30
2.2 Exploratory Data Analysis (EDA) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
2.3 La Documentazione e la Descrizione del Dataset . . . . . . . . . . . . . . . . . . . . 32
2.4 Interpretable Feature Engineering . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34
3 In-modeling Explainability 36
3.1 Alberi di Decisione . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 37
3.2 Induzione e Classificazione tramite Regole Decisionali . . . . . . . . . . . . . . . . . 43
3.3 Regressione Lineare e Interpretazione dei Coefficienti . . . . . . . . . . . . . . . . . . 45
3.4 Regressione Logistica e Trasformazione Log Odds . . . . . . . . . . . . . . . . . . . . 46
3.5 Classificatore Naïve Bayes e Importanza delle Feature . . . . . . . . . . . . . . . . . 48
3.6 Classificatori basati sulle Istanze e l’Algoritmo KNN . . . . . . . . . . . . . . . . . . 49
3.7 Explainable Modeling e Interpretabilità by Design . . . . . . . . . . . . . . . . . . . 49
3.8 Modelli basati sui Colli di Bottiglia Concettuali . . . . . . . . . . . . . . . . . . . . . 51
3.9 Explanations-in-the-loop e l’Approccio TED . . . . . . . . . . . . . . . . . . . . . . . 51
4 Post Modelling 54
4.1 Generalizzabilità dei Metodi: Model-Dependent vs Model-Agnostic . . . . . . . . . . 54
4.2 Spiegazioni Globali e Modelli Surrogati . . . . . . . . . . . . . . . . . . . . . . . . . . 55
4.3 Permutation Feature Importance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
4.4 Partial Dependence Plots (PDP) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
5 Local surrogate interpretable model 64
5.1 Metodologie per derivare spiegazioni . . . . . . . . . . . . . . . . . . . . . . . . . . . 64
5.2 LIME: Local Interpretable Model-Agnostic Explanations . . . . . . . . . . . . . . . . 65
5.3 Rappresentazioni dei Dati Interpretabili . . . . . . . . . . . . . . . . . . . . . . . . . 67
5.4 Definizione della Località della Previsione . . . . . . . . . . . . . . . . . . . . . . . . 68
5.5 Scelta del Modello Interpretabile (g) . . . . . . . . . . . . . . . . . . . . . . . . . . . 70
5.6 LORE: Local Rule-Based Explanations . . . . . . . . . . . . . . . . . . . . . . . . . . 71
5.7 LACE: Spiegazioni tramite Classificatori Associativi . . . . . . . . . . . . . . . . . . 72
6 Explaining by removing 74
6.1 Il Metodo PredDiff (Prediction Difference) . . . . . . . . . . . . . . . . . . . . . . . . 74
6.2 Introduzione ai Valori di Shapley e Teoria dei Giochi . . . . . . . . . . . . . . . . . . 75
6.3 L’Architettura di SHAP (SHapley Additive exPlanations) . . . . . . . . . . . . . . . 81
6.4 SHAP: Approfondimenti Globali (Global Insights) . . . . . . . . . . . . . . . . . . . 88
6.5 Unificazione delle Spiegazioni Basate sulla Rimozione (Removal-Based Explanations) 91
1
7 Metodi Gradient Based 94
7.1 Introduzione ai metodi Gradient Based . . . . . . . . . . . . . . . . . . . . . . . . . . 94
7.2 I Gradienti per la Spiegabilità e il Metodo ”Vanilla Gradient” . . . . . . . . . . . . . 95
7.3 SmoothGrad . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 100
7.4 Il Metodo Grad-CAM (Gradient-weighted Class Activation Mapping) . . . . . . . . . 102
7.5 I Fondamenti di Integrated Gradients . . . . . . . . . . . . . . . . . . . . . . . . . . 106
8 Valutazione della spiegabilità 111
8.1 Dalla Valutazione Aneddotica alla Sistematizzazione . . . . . . . . . . . . . . . . . . 111
8.2 Proprietà Intrinseche del Contenuto e del Modello . . . . . . . . . . . . . . . . . . . 112
8.3 Proprietà di Presentazione delle Spiegazioni . . . . . . . . . . . . . . . . . . . . . . . 113
8.4 Proprietà Relative all’Utente . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 113
8.5 Metodi per la Valutazione della Qualità delle Spiegazioni . . . . . . . . . . . . . . . . 114
9 Concept-based Explainable AI 119
9.1 Motivazioni: I limiti della Standard Explainable AI . . . . . . . . . . . . . . . . . . . 119
9.2 Concept-based Explainable AI . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 120
9.3 Definizione e Tipologie di Concetti nella C-XAI . . . . . . . . . . . . . . . . . . . . . 122
9.4 Approcci Post-hoc ed Explainable-by-design . . . . . . . . . . . . . . . . . . . . . . . 125
9.5 Tassonomia dei Metodi Concept-based . . . . . . . . . . . . . . . . . . . . . . . . . . 127
9.6 T-CAV . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 134
9.7 Concept Bottleneck Models (CBM) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 141
9.8 Concept Embedding Models (CEM): Architettura e Flusso Operativo . . . . . . . . 148
10 NLP 151
10.1 Principali compiti dell’NLP . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 151
10.2 La rappresentazione del significato delle parole . . . . . . . . . . . . . . . . . . . . . 151
10.3 Operazioni Algebriche sui Vettori e Relazioni Semantiche . . . . . . . . . . . . . . . 153
10.4 Modellazione del Linguaggio tramite Multilayer Perceptron (MLP) . . . . . . . . . . 155
10.5 Reti Neurali Ricorrenti (RNN) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 156
10.6 Miglioramenti delle architetture ricorrenti . . . . . . . . . . . . . . . . . . . . . . . . 159
10.7 L’architettura Transformer: Encoder e Decoder . . . . . . . . . . . . . . . . . . . . . 166
10.8 BERT: Bidirectional Encoder Representations from Transformers . . . . . . . . . . . 169
11 Spiegazioni Controfattuali 173
11.1 Introduzione alle Spiegazioni Controfattuali . . . . . . . . . . . . . . . . . . . . . . . 173
11.2 L’Algoritmo di Wachter et al. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 174
11.3 Il Metodo DiCE (Diverse Counterfactual Explanations) . . . . . . . . . . . . . . . . 176
11.4 Generazione di Controfattuali per il Natural Language Processing (NLP) . . . . . . 177
11.5 Valutazione delle Spiegazioni Controfattuali . . . . . . . . . . . . . . . . . . . . . . . 178
12 Attention Based Explainability 181
12.1 Il Meccanismo di Attenzione . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 181
12.2 Multi-Head Attention . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 184
12.3 Il Transformer e le Architetture Attenzionali . . . . . . . . . . . . . . . . . . . . . . 186
12.4 L’Explainability basata sull’Attenzione . . . . . . . . . . . . . . . . . . . . . . . . . . 188
2
Emmanuel Messina - Explainable And Trustworthy AI 2025/2026
13 Interpretability Meccanicistica 193
13.1 Interpretability Meccanicistica nelle Reti Neurali Convoluzionali (CNN) . . . . . . . 193
13.2 Feature Visualization . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 194
13.3 Circuiti Computazionali e Motivi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 196
13.4 Interpretability Meccanicistica nei Large Language Models (LLMs) . . . . . . . . . . 199
14 Attacchi Avversari e Robustezza dei Modelli 210
14.1 Introduzione agli Attacchi Avversari e Definizioni Fondamentali . . . . . . . . . . . . 210
14.2 Tassonomia e Classificazione degli Attacchi Avversari . . . . . . . . . . . . . . . . . . 213
14.3 Evoluzione Storica degli Attacchi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 214
14.4 Attacchi Avversari sui Large Language Models (LLM) . . . . . . . . . . . . . . . . . 220
14.5 Approcci di Detezione Pura e Add-ons Reticolari . . . . . . . . . . . . . . . . . . . . 224
14.6 Tool e Framework per il Penetration Testing dei Modelli . . . . . . . . . . . . . . . . 225
Prima di iniziare a studiare da questi appunti è necessario che tu sappia che, nonostante
Premessa
si sia cercato di fare gli appunti nel miglior modo possibile sia per ripassare al meglio e sia per poter
creare un materiale utile per altri studenti, che ci potrebbero ugualmente essere imprecisioni, errori
di scrittura o altro. In caso di problemi si prega di contattarmi via mail: s333951@studenti.polito.it,
su instagram: oppure sul canale telegram: Se vuoi
@emmanuelmessina00 CLICCA QUI.
sostenere il lavoro svolto, puoi offrirmi un caffè (1 euro) qui: CLICCA QUI.
3
Emmanuel Messina - Explainable And Trustworthy AI 2025/2026
1 Affidabilità AI
1.1 La Pervasività dei Modelli di Machine Learning e il Problema della
Fiducia
I modelli di apprendimento automatico hanno ormai permeato innumerevoli settori della società
odierna. Le loro applicazioni spaziano dal mondo della finanza alla diagnostica medica, passando
per i sistemi di raccomandazione, le reti sociali, l’ambito legale e lo sviluppo delle smart cities.
Di fronte a questa diffusione capillare, emerge un interrogativo fondamentale sulla reale affid-
abilità di questi strumenti. Vi sono infatti diverse criticità che minano la fiducia nei sistemi di
Intelligenza Artificiale, a partire dal fatto che essi possono apprendere pattern che, seppur statisti-
camente veritieri all’interno dei dati di addestramento, si rivelano estremamente pericolosi o persino
fatali se implementati nel mondo reale. Gli algoritmi rischiano inoltre di assimilare e riprodurre
dinamiche ingiuste e discriminatorie, un problema che si è manifestato in sistemi di previsione della
recidiva criminale, come COMPAS, o in vari strumenti di selezione del personale. I modelli sono
anche vulnerabili e possono essere ingannati. Quando commettono errori sollevano complesse ques-
tioni di responsabilità, e spesso perpetuano pregiudizi storici preesistenti, portando a una generale
mancanza di fiducia, evidente in sistemi usati per la previsione dei punteggi degli esami o del merito
creditizio. Risulta quindi evidente come non sia affatto un compito semplice rendere questi modelli
equi e imparziali.
Un ambito critico in cui la fiducia e la trasparenza giocano un ruolo vitale è quello dell’assis-
tenza sanitaria, dove si registra una crescente adozione dell’IA per la diagnosi medica. L’utilizzo di
questi sistemi è supportato dalla loro capacità di fornire risultati estremamente accurati, al punto
da superare talvolta le prestazioni dei medici umani, come dimostrato nel caso della diagnostica del
cancro al seno riportato in uno studio su del 2020.
Nature 4
Emmanuel Messina - Explainable And Trustworthy AI 2025/2026
Tuttavia, l’entusiasmo per tali risultati deve scontrarsi con la forte necessità di trasparenza.
Ricercatori del settore hanno evidenziato in articoli di risposta come l’omissione di dettagli cruciali
sulle metodologie impiegate e l’indisponibilità del codice dell’algoritmo minino profondamente il
valore scientifico di queste scoperte. Diventa pertanto necessario identificare e superare gli ostacoli
che frenano una ricerca sull’IA trasparente e riproducibile, fornendo soluzioni adeguate per pro-
gredire in questo settore.
L’importanza dell’interpretabilità dei modelli è illustrata in modo esemplare da un caso di stu-
dio volto a prevedere il rischio di decesso in pazienti ospedalizzati affetti da polmonite. Durante
lo sviluppo del progetto, sono stati creati due modelli distinti: il primo risultava interpretabile ma
presentava un’accuratezza inferiore, mentre il secondo era molto più accurato ma agiva in modo non
interpretabile. La scelta operativa è ricaduta sul modello interpretabile, accettando il compromesso
di una minore precisione statistica a favore della vitale necessità di comprendere le ragioni alla base
di ogni singola previsione.
Analizzando i risultati, è emersa un’associazione fortemente controintuitiva: il sistema aveva
dedotto che i pazienti con una storia clinica di asma presentavano una minore probabilità di morire
5
Emmanuel Messina - Explainable And Trustworthy AI 2025/2026
a causa della polmonite. Da un punto di vista strettamente clinico, questa deduzione è parados-
sale, in quanto l’asma rappresenta un grave fattore di rischio per chi contrae la polmonite. Grazie
all’interpretabilità, è stato possibile comprendere che questa associazione rifletteva un pattern reale
presente nei dati, ma generato dalle dinamiche del sistema sanitario: i pazienti asmatici ricevono
maggiore attenzione, notano i sintomi in anticipo e, di conseguenza, ottengono cure di alta qualità
più tempestivamente rispetto alla popolazione generale, abbassando così il loro tasso di mortal-
ità effettivo. Se questo modello fosse stato utilizzato acriticamente per decidere l’assegnazione dei
ricoveri, si sarebbe verificata una situazione fatale, poiché i pazienti asmatici sarebbero stati clas-
sificati a basso rischio e si sarebbero visti negare la precedenza per le cure.
La capacità degli esperti di dominio di ispezionare il modello è stata quindi essenziale per identificare
e neutralizzare questa anomalia. Utilizzando il modello non interpretabile, seppur apparentemente
più preciso, questa associazione pericolosa non sarebbe mai stata scoperta e il sistema avrebbe
potuto basare le proprie decisioni su altri pattern nascosti e altrettanto dannosi. Pertanto, in
applicazioni ad alto rischio come quella sanitaria, è un requisito imprescindibile che gli esperti pos-
sano analizzare il modello per comprenderne a fondo il comportamento, al fine di determinare con
sicurezza se esso possa essere considerato affidabile e idoneo all’impiego reale. L’impiego
L’Apprendimento di Pattern Ingiusti e Discriminatori: Il Caso COMPAS
dell’Intelligenza Artificiale in ambito giudiziario ha messo in luce come i modelli possano apprendere
pattern ingiusti e discriminatori. Un esempio emblematico è rappresentato da COMPAS, uno stru-
mento di valutazione del rischio progettato per assistere i giudici nel prendere decisioni informate,
calcolando il punteggio di rischio di recidiva criminale degli imputati. Un’indagine condotta dai
giornalisti di ProPublica ha preso in esame i dati relativi a 7.000 persone arrestate nella contea di
Broward, in Florida, tra il 2013 e il 2014. L’analisi si è concentrata sul confronto tra i punteggi di
rischio assegnati dall’algoritmo e l’effettiva recidiva, verificando se gli individui in questione fossero
stati accusati di nuovi reati in un periodo successivo di due anni.
I risultati dell’analisi hanno rivelato significative disparità razziali nelle valutazioni del sistema.
L’algoritmo, infatti, tendeva ad assegnare erroneamente un alto rischio di recidiva agli imputati
afroamericani. Il tasso di falsi positivi per questa demografica è risultato essere quasi il doppio
rispetto a quello registrato per gli imputati bianchi. In senso opposto, gli imputati bianchi veni-
vano etichettati erroneamente come a basso rischio con una frequenza molto maggiore rispetto agli
imputati neri. Per comprendere concretamente queste distorsioni, è utile analizzare alcuni casi
specifici. In una circostanza di furto minore, a un individuo bianco, Vernon Prater, è stato asseg-
nato un livello di rischio basso con un punteggio di 3, mentre a una ragazza afroamericana, Brisha
Borden, è stato assegnato un rischio alto con un punteggio di 8.
6
Emmanuel Messina - Explainable And Trustworthy AI 2025/2026
Brisha Borden era stata valutata ad alto rischio per aver sottratto una bicicletta e un monopat-
tino per bambini lasciati all’esterno, ma successivamente non ha commesso alcun nuovo reato. In
un altro caso relativo al possesso di droga, a un imputato bianco, Dylan Fugett, è stato assegnato
un rischio basso pari a 3 dopo un arresto per possesso di cocaina e marijuana; tuttavia, in seguito
è stato arrestato altre tre volte per reati legati agli stupefacenti. Parallelamente, a un imputato
afroamericano, Bernard Parker, è stato assegnato un livello di rischio estremamente alto, con un
punteggio di 10. I modelli
La Replicazione dei Pregiudizi Storici: Il Caso della Selezione del Personale
predittivi possono interiorizzare e replicare comportamenti discriminatori anche nel settore delle
risorse umane. Un caso particolarmente rilevante riguarda un algoritmo di selezione del personale
basato sull’IA che ha manifestato un forte pregiudizio nei confronti delle candidature femminili. Il
sistema di reclutamento, infatti, penalizzava attivamente le applicazioni delle candidate che ave-
vano frequentato college esclusivamente femminili e declassava i curriculum vitae in cui era presente
la parola “donne” o “femminile”, come ad esempio l’appartenenza a un “circolo di scacchi fem-
minile”. Questa dinamica deriva dal principio fondamentale secondo cui i sistemi di IA apprendono
a prendere decisioni analizzando enormi moli di dati storici. Di conseguenza, se tali dati riflet-
tono dinamiche passate squilibrate, i modelli finiscono inevitabilmente per perpetuare i pregiudizi
preesistenti nella società. Nel caso specifico di questo strumento sviluppato internamente da Ama-
zon, il pregiudizio si è originato dalla natura demografica del settore tecnologico, storicamente
caratterizzato come un ambiente di lavoro a forte predominanza maschile. L’algoritmo, analizzan-
do i modelli di assunzione del passato, ha erroneamente dedotto dai dati storici che le caratteristiche
tipicamente maschili fossero un requisito intrinseco per il successo lavorativo, costringendo infine
l’azienda ad abbandonare il progetto in quanto viziato alla radice.
I modelli di apprendimento automatico,
Vulnerabilità dei Modelli e Attacchi Avversari
nonostante i livelli di accuratezza raggiunti, presentano delle vulnerabilità intrinseche e possono
essere ingannati con relativa facilità. Nel 2015, alcuni ricercatori hanno dimo
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
-
Appunti completi Explainable artificial intelligence
-
Appunti AI: Machine Learning and Pattern Recognition
-
Appunti esame International and European Economic and Financial Law, prof. Saravalle
-
Appunti completi di Design and innovation management