Estratto del documento

Corso di Laurea Magistrale in Informatica

Appunti di Explainable And Trustworthy

AI

Anno Accademico 2025/2026

Studente: Emmanuel Messina

Politecnico Di Torino

Indice

1 Affidabilità AI 4

1.1 La Pervasività dei Modelli di Machine Learning e il Problema della Fiducia . . . . . 4

1.2 La Necessità di un’Intelligenza Artificiale Affidabile e i Suoi Requisiti . . . . . . . . . 10

1.3 Tassonomia . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18

2 Pre-Modeling Explainability 30

2.1 Introduzione alla Explainability e le sue Fasi . . . . . . . . . . . . . . . . . . . . . . 30

2.2 Exploratory Data Analysis (EDA) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31

2.3 La Documentazione e la Descrizione del Dataset . . . . . . . . . . . . . . . . . . . . 32

2.4 Interpretable Feature Engineering . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34

3 In-modeling Explainability 36

3.1 Alberi di Decisione . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 37

3.2 Induzione e Classificazione tramite Regole Decisionali . . . . . . . . . . . . . . . . . 43

3.3 Regressione Lineare e Interpretazione dei Coefficienti . . . . . . . . . . . . . . . . . . 45

3.4 Regressione Logistica e Trasformazione Log Odds . . . . . . . . . . . . . . . . . . . . 46

3.5 Classificatore Naïve Bayes e Importanza delle Feature . . . . . . . . . . . . . . . . . 48

3.6 Classificatori basati sulle Istanze e l’Algoritmo KNN . . . . . . . . . . . . . . . . . . 49

3.7 Explainable Modeling e Interpretabilità by Design . . . . . . . . . . . . . . . . . . . 49

3.8 Modelli basati sui Colli di Bottiglia Concettuali . . . . . . . . . . . . . . . . . . . . . 51

3.9 Explanations-in-the-loop e l’Approccio TED . . . . . . . . . . . . . . . . . . . . . . . 51

4 Post Modelling 54

4.1 Generalizzabilità dei Metodi: Model-Dependent vs Model-Agnostic . . . . . . . . . . 54

4.2 Spiegazioni Globali e Modelli Surrogati . . . . . . . . . . . . . . . . . . . . . . . . . . 55

4.3 Permutation Feature Importance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57

4.4 Partial Dependence Plots (PDP) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59

5 Local surrogate interpretable model 64

5.1 Metodologie per derivare spiegazioni . . . . . . . . . . . . . . . . . . . . . . . . . . . 64

5.2 LIME: Local Interpretable Model-Agnostic Explanations . . . . . . . . . . . . . . . . 65

5.3 Rappresentazioni dei Dati Interpretabili . . . . . . . . . . . . . . . . . . . . . . . . . 67

5.4 Definizione della Località della Previsione . . . . . . . . . . . . . . . . . . . . . . . . 68

5.5 Scelta del Modello Interpretabile (g) . . . . . . . . . . . . . . . . . . . . . . . . . . . 70

5.6 LORE: Local Rule-Based Explanations . . . . . . . . . . . . . . . . . . . . . . . . . . 71

5.7 LACE: Spiegazioni tramite Classificatori Associativi . . . . . . . . . . . . . . . . . . 72

6 Explaining by removing 74

6.1 Il Metodo PredDiff (Prediction Difference) . . . . . . . . . . . . . . . . . . . . . . . . 74

6.2 Introduzione ai Valori di Shapley e Teoria dei Giochi . . . . . . . . . . . . . . . . . . 75

6.3 L’Architettura di SHAP (SHapley Additive exPlanations) . . . . . . . . . . . . . . . 81

6.4 SHAP: Approfondimenti Globali (Global Insights) . . . . . . . . . . . . . . . . . . . 88

6.5 Unificazione delle Spiegazioni Basate sulla Rimozione (Removal-Based Explanations) 91

1

7 Metodi Gradient Based 94

7.1 Introduzione ai metodi Gradient Based . . . . . . . . . . . . . . . . . . . . . . . . . . 94

7.2 I Gradienti per la Spiegabilità e il Metodo ”Vanilla Gradient” . . . . . . . . . . . . . 95

7.3 SmoothGrad . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 100

7.4 Il Metodo Grad-CAM (Gradient-weighted Class Activation Mapping) . . . . . . . . . 102

7.5 I Fondamenti di Integrated Gradients . . . . . . . . . . . . . . . . . . . . . . . . . . 106

8 Valutazione della spiegabilità 111

8.1 Dalla Valutazione Aneddotica alla Sistematizzazione . . . . . . . . . . . . . . . . . . 111

8.2 Proprietà Intrinseche del Contenuto e del Modello . . . . . . . . . . . . . . . . . . . 112

8.3 Proprietà di Presentazione delle Spiegazioni . . . . . . . . . . . . . . . . . . . . . . . 113

8.4 Proprietà Relative all’Utente . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 113

8.5 Metodi per la Valutazione della Qualità delle Spiegazioni . . . . . . . . . . . . . . . . 114

9 Concept-based Explainable AI 119

9.1 Motivazioni: I limiti della Standard Explainable AI . . . . . . . . . . . . . . . . . . . 119

9.2 Concept-based Explainable AI . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 120

9.3 Definizione e Tipologie di Concetti nella C-XAI . . . . . . . . . . . . . . . . . . . . . 122

9.4 Approcci Post-hoc ed Explainable-by-design . . . . . . . . . . . . . . . . . . . . . . . 125

9.5 Tassonomia dei Metodi Concept-based . . . . . . . . . . . . . . . . . . . . . . . . . . 127

9.6 T-CAV . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 134

9.7 Concept Bottleneck Models (CBM) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 141

9.8 Concept Embedding Models (CEM): Architettura e Flusso Operativo . . . . . . . . 148

10 NLP 151

10.1 Principali compiti dell’NLP . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 151

10.2 La rappresentazione del significato delle parole . . . . . . . . . . . . . . . . . . . . . 151

10.3 Operazioni Algebriche sui Vettori e Relazioni Semantiche . . . . . . . . . . . . . . . 153

10.4 Modellazione del Linguaggio tramite Multilayer Perceptron (MLP) . . . . . . . . . . 155

10.5 Reti Neurali Ricorrenti (RNN) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 156

10.6 Miglioramenti delle architetture ricorrenti . . . . . . . . . . . . . . . . . . . . . . . . 159

10.7 L’architettura Transformer: Encoder e Decoder . . . . . . . . . . . . . . . . . . . . . 166

10.8 BERT: Bidirectional Encoder Representations from Transformers . . . . . . . . . . . 169

11 Spiegazioni Controfattuali 173

11.1 Introduzione alle Spiegazioni Controfattuali . . . . . . . . . . . . . . . . . . . . . . . 173

11.2 L’Algoritmo di Wachter et al. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 174

11.3 Il Metodo DiCE (Diverse Counterfactual Explanations) . . . . . . . . . . . . . . . . 176

11.4 Generazione di Controfattuali per il Natural Language Processing (NLP) . . . . . . 177

11.5 Valutazione delle Spiegazioni Controfattuali . . . . . . . . . . . . . . . . . . . . . . . 178

12 Attention Based Explainability 181

12.1 Il Meccanismo di Attenzione . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 181

12.2 Multi-Head Attention . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 184

12.3 Il Transformer e le Architetture Attenzionali . . . . . . . . . . . . . . . . . . . . . . 186

12.4 L’Explainability basata sull’Attenzione . . . . . . . . . . . . . . . . . . . . . . . . . . 188

2

Emmanuel Messina - Explainable And Trustworthy AI 2025/2026

13 Interpretability Meccanicistica 193

13.1 Interpretability Meccanicistica nelle Reti Neurali Convoluzionali (CNN) . . . . . . . 193

13.2 Feature Visualization . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 194

13.3 Circuiti Computazionali e Motivi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 196

13.4 Interpretability Meccanicistica nei Large Language Models (LLMs) . . . . . . . . . . 199

14 Attacchi Avversari e Robustezza dei Modelli 210

14.1 Introduzione agli Attacchi Avversari e Definizioni Fondamentali . . . . . . . . . . . . 210

14.2 Tassonomia e Classificazione degli Attacchi Avversari . . . . . . . . . . . . . . . . . . 213

14.3 Evoluzione Storica degli Attacchi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 214

14.4 Attacchi Avversari sui Large Language Models (LLM) . . . . . . . . . . . . . . . . . 220

14.5 Approcci di Detezione Pura e Add-ons Reticolari . . . . . . . . . . . . . . . . . . . . 224

14.6 Tool e Framework per il Penetration Testing dei Modelli . . . . . . . . . . . . . . . . 225

Prima di iniziare a studiare da questi appunti è necessario che tu sappia che, nonostante

Premessa

si sia cercato di fare gli appunti nel miglior modo possibile sia per ripassare al meglio e sia per poter

creare un materiale utile per altri studenti, che ci potrebbero ugualmente essere imprecisioni, errori

di scrittura o altro. In caso di problemi si prega di contattarmi via mail: s333951@studenti.polito.it,

su instagram: oppure sul canale telegram: Se vuoi

@emmanuelmessina00 CLICCA QUI.

sostenere il lavoro svolto, puoi offrirmi un caffè (1 euro) qui: CLICCA QUI.

3

Emmanuel Messina - Explainable And Trustworthy AI 2025/2026

1 Affidabilità AI

1.1 La Pervasività dei Modelli di Machine Learning e il Problema della

Fiducia

I modelli di apprendimento automatico hanno ormai permeato innumerevoli settori della società

odierna. Le loro applicazioni spaziano dal mondo della finanza alla diagnostica medica, passando

per i sistemi di raccomandazione, le reti sociali, l’ambito legale e lo sviluppo delle smart cities.

Di fronte a questa diffusione capillare, emerge un interrogativo fondamentale sulla reale affid-

abilità di questi strumenti. Vi sono infatti diverse criticità che minano la fiducia nei sistemi di

Intelligenza Artificiale, a partire dal fatto che essi possono apprendere pattern che, seppur statisti-

camente veritieri all’interno dei dati di addestramento, si rivelano estremamente pericolosi o persino

fatali se implementati nel mondo reale. Gli algoritmi rischiano inoltre di assimilare e riprodurre

dinamiche ingiuste e discriminatorie, un problema che si è manifestato in sistemi di previsione della

recidiva criminale, come COMPAS, o in vari strumenti di selezione del personale. I modelli sono

anche vulnerabili e possono essere ingannati. Quando commettono errori sollevano complesse ques-

tioni di responsabilità, e spesso perpetuano pregiudizi storici preesistenti, portando a una generale

mancanza di fiducia, evidente in sistemi usati per la previsione dei punteggi degli esami o del merito

creditizio. Risulta quindi evidente come non sia affatto un compito semplice rendere questi modelli

equi e imparziali.

Un ambito critico in cui la fiducia e la trasparenza giocano un ruolo vitale è quello dell’assis-

tenza sanitaria, dove si registra una crescente adozione dell’IA per la diagnosi medica. L’utilizzo di

questi sistemi è supportato dalla loro capacità di fornire risultati estremamente accurati, al punto

da superare talvolta le prestazioni dei medici umani, come dimostrato nel caso della diagnostica del

cancro al seno riportato in uno studio su del 2020.

Nature 4

Emmanuel Messina - Explainable And Trustworthy AI 2025/2026

Tuttavia, l’entusiasmo per tali risultati deve scontrarsi con la forte necessità di trasparenza.

Ricercatori del settore hanno evidenziato in articoli di risposta come l’omissione di dettagli cruciali

sulle metodologie impiegate e l’indisponibilità del codice dell’algoritmo minino profondamente il

valore scientifico di queste scoperte. Diventa pertanto necessario identificare e superare gli ostacoli

che frenano una ricerca sull’IA trasparente e riproducibile, fornendo soluzioni adeguate per pro-

gredire in questo settore.

L’importanza dell’interpretabilità dei modelli è illustrata in modo esemplare da un caso di stu-

dio volto a prevedere il rischio di decesso in pazienti ospedalizzati affetti da polmonite. Durante

lo sviluppo del progetto, sono stati creati due modelli distinti: il primo risultava interpretabile ma

presentava un’accuratezza inferiore, mentre il secondo era molto più accurato ma agiva in modo non

interpretabile. La scelta operativa è ricaduta sul modello interpretabile, accettando il compromesso

di una minore precisione statistica a favore della vitale necessità di comprendere le ragioni alla base

di ogni singola previsione.

Analizzando i risultati, è emersa un’associazione fortemente controintuitiva: il sistema aveva

dedotto che i pazienti con una storia clinica di asma presentavano una minore probabilità di morire

5

Emmanuel Messina - Explainable And Trustworthy AI 2025/2026

a causa della polmonite. Da un punto di vista strettamente clinico, questa deduzione è parados-

sale, in quanto l’asma rappresenta un grave fattore di rischio per chi contrae la polmonite. Grazie

all’interpretabilità, è stato possibile comprendere che questa associazione rifletteva un pattern reale

presente nei dati, ma generato dalle dinamiche del sistema sanitario: i pazienti asmatici ricevono

maggiore attenzione, notano i sintomi in anticipo e, di conseguenza, ottengono cure di alta qualità

più tempestivamente rispetto alla popolazione generale, abbassando così il loro tasso di mortal-

ità effettivo. Se questo modello fosse stato utilizzato acriticamente per decidere l’assegnazione dei

ricoveri, si sarebbe verificata una situazione fatale, poiché i pazienti asmatici sarebbero stati clas-

sificati a basso rischio e si sarebbero visti negare la precedenza per le cure.

La capacità degli esperti di dominio di ispezionare il modello è stata quindi essenziale per identificare

e neutralizzare questa anomalia. Utilizzando il modello non interpretabile, seppur apparentemente

più preciso, questa associazione pericolosa non sarebbe mai stata scoperta e il sistema avrebbe

potuto basare le proprie decisioni su altri pattern nascosti e altrettanto dannosi. Pertanto, in

applicazioni ad alto rischio come quella sanitaria, è un requisito imprescindibile che gli esperti pos-

sano analizzare il modello per comprenderne a fondo il comportamento, al fine di determinare con

sicurezza se esso possa essere considerato affidabile e idoneo all’impiego reale. L’impiego

L’Apprendimento di Pattern Ingiusti e Discriminatori: Il Caso COMPAS

dell’Intelligenza Artificiale in ambito giudiziario ha messo in luce come i modelli possano apprendere

pattern ingiusti e discriminatori. Un esempio emblematico è rappresentato da COMPAS, uno stru-

mento di valutazione del rischio progettato per assistere i giudici nel prendere decisioni informate,

calcolando il punteggio di rischio di recidiva criminale degli imputati. Un’indagine condotta dai

giornalisti di ProPublica ha preso in esame i dati relativi a 7.000 persone arrestate nella contea di

Broward, in Florida, tra il 2013 e il 2014. L’analisi si è concentrata sul confronto tra i punteggi di

rischio assegnati dall’algoritmo e l’effettiva recidiva, verificando se gli individui in questione fossero

stati accusati di nuovi reati in un periodo successivo di due anni.

I risultati dell’analisi hanno rivelato significative disparità razziali nelle valutazioni del sistema.

L’algoritmo, infatti, tendeva ad assegnare erroneamente un alto rischio di recidiva agli imputati

afroamericani. Il tasso di falsi positivi per questa demografica è risultato essere quasi il doppio

rispetto a quello registrato per gli imputati bianchi. In senso opposto, gli imputati bianchi veni-

vano etichettati erroneamente come a basso rischio con una frequenza molto maggiore rispetto agli

imputati neri. Per comprendere concretamente queste distorsioni, è utile analizzare alcuni casi

specifici. In una circostanza di furto minore, a un individuo bianco, Vernon Prater, è stato asseg-

nato un livello di rischio basso con un punteggio di 3, mentre a una ragazza afroamericana, Brisha

Borden, è stato assegnato un rischio alto con un punteggio di 8.

6

Emmanuel Messina - Explainable And Trustworthy AI 2025/2026

Brisha Borden era stata valutata ad alto rischio per aver sottratto una bicicletta e un monopat-

tino per bambini lasciati all’esterno, ma successivamente non ha commesso alcun nuovo reato. In

un altro caso relativo al possesso di droga, a un imputato bianco, Dylan Fugett, è stato assegnato

un rischio basso pari a 3 dopo un arresto per possesso di cocaina e marijuana; tuttavia, in seguito

è stato arrestato altre tre volte per reati legati agli stupefacenti. Parallelamente, a un imputato

afroamericano, Bernard Parker, è stato assegnato un livello di rischio estremamente alto, con un

punteggio di 10. I modelli

La Replicazione dei Pregiudizi Storici: Il Caso della Selezione del Personale

predittivi possono interiorizzare e replicare comportamenti discriminatori anche nel settore delle

risorse umane. Un caso particolarmente rilevante riguarda un algoritmo di selezione del personale

basato sull’IA che ha manifestato un forte pregiudizio nei confronti delle candidature femminili. Il

sistema di reclutamento, infatti, penalizzava attivamente le applicazioni delle candidate che ave-

vano frequentato college esclusivamente femminili e declassava i curriculum vitae in cui era presente

la parola “donne” o “femminile”, come ad esempio l’appartenenza a un “circolo di scacchi fem-

minile”. Questa dinamica deriva dal principio fondamentale secondo cui i sistemi di IA apprendono

a prendere decisioni analizzando enormi moli di dati storici. Di conseguenza, se tali dati riflet-

tono dinamiche passate squilibrate, i modelli finiscono inevitabilmente per perpetuare i pregiudizi

preesistenti nella società. Nel caso specifico di questo strumento sviluppato internamente da Ama-

zon, il pregiudizio si è originato dalla natura demografica del settore tecnologico, storicamente

caratterizzato come un ambiente di lavoro a forte predominanza maschile. L’algoritmo, analizzan-

do i modelli di assunzione del passato, ha erroneamente dedotto dai dati storici che le caratteristiche

tipicamente maschili fossero un requisito intrinseco per il successo lavorativo, costringendo infine

l’azienda ad abbandonare il progetto in quanto viziato alla radice.

I modelli di apprendimento automatico,

Vulnerabilità dei Modelli e Attacchi Avversari

nonostante i livelli di accuratezza raggiunti, presentano delle vulnerabilità intrinseche e possono

essere ingannati con relativa facilità. Nel 2015, alcuni ricercatori hanno dimo

Anteprima
Vedrai una selezione di 10 pagine su 227
Explainable and Trustworthy AI - Appunti completi (XAI, SHAP, LIME, CBM, Grad-CAM, LLM) Pag. 1 Explainable and Trustworthy AI - Appunti completi (XAI, SHAP, LIME, CBM, Grad-CAM, LLM) Pag. 2
Anteprima di 10 pagg. su 227.
Scarica il documento per vederlo tutto.
Explainable and Trustworthy AI - Appunti completi (XAI, SHAP, LIME, CBM, Grad-CAM, LLM) Pag. 6
Anteprima di 10 pagg. su 227.
Scarica il documento per vederlo tutto.
Explainable and Trustworthy AI - Appunti completi (XAI, SHAP, LIME, CBM, Grad-CAM, LLM) Pag. 11
Anteprima di 10 pagg. su 227.
Scarica il documento per vederlo tutto.
Explainable and Trustworthy AI - Appunti completi (XAI, SHAP, LIME, CBM, Grad-CAM, LLM) Pag. 16
Anteprima di 10 pagg. su 227.
Scarica il documento per vederlo tutto.
Explainable and Trustworthy AI - Appunti completi (XAI, SHAP, LIME, CBM, Grad-CAM, LLM) Pag. 21
Anteprima di 10 pagg. su 227.
Scarica il documento per vederlo tutto.
Explainable and Trustworthy AI - Appunti completi (XAI, SHAP, LIME, CBM, Grad-CAM, LLM) Pag. 26
Anteprima di 10 pagg. su 227.
Scarica il documento per vederlo tutto.
Explainable and Trustworthy AI - Appunti completi (XAI, SHAP, LIME, CBM, Grad-CAM, LLM) Pag. 31
Anteprima di 10 pagg. su 227.
Scarica il documento per vederlo tutto.
Explainable and Trustworthy AI - Appunti completi (XAI, SHAP, LIME, CBM, Grad-CAM, LLM) Pag. 36
Anteprima di 10 pagg. su 227.
Scarica il documento per vederlo tutto.
Explainable and Trustworthy AI - Appunti completi (XAI, SHAP, LIME, CBM, Grad-CAM, LLM) Pag. 41
1 su 227
D/illustrazione/soddisfatti o rimborsati
Acquista con carta o PayPal
Scarica i documenti tutte le volte che vuoi
Dettagli
SSD
Scienze matematiche e informatiche INF/01 Informatica

I contenuti di questa pagina costituiscono rielaborazioni personali del Publisher emmanuelmessina00 di informazioni apprese con la frequenza delle lezioni di Explainable ai e studio autonomo di eventuali libri di riferimento in preparazione dell'esame finale o della tesi. Non devono intendersi come materiale ufficiale dell'università Politecnico di Torino o del prof Baralis Elena.
Appunti correlati Invia appunti e guadagna

Domande e risposte

Hai bisogno di aiuto?
Chiedi alla community