Estratto del documento

EXPLAINABLE ARTIFICIAL INTELLIGENCE

18 giugno 2026

INDICE

1 Introduzione e Concetti Generali 4

1.1 Evaluation Explainability . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11

1.1.1 Evaluating explainability . . . . . . . . . . . . . . . . . . . . . . . . . . 12

1.1.2 Model Parameter Randomization Check . . . . . . . . . . . . . . . . . . 14

1.1.3 Incremental Feature Deletion . . . . . . . . . . . . . . . . . . . . . . . . 14

1.2 Bias e Fairness . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15

1.2.1 Bias . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16

1.2.2 Paradosso di Simpson . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16

1.2.3 Bias negli Algoritmi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19

1.3 Fairness . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20

1.4 Data Visualization . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21

2 Modelli Interpretabili 24

2.1 Alberi di Decisione . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24

2.1.1 Criteri di splitting: entropia e Gini Index . . . . . . . . . . . . . . . . . 25

2.2 Modelli basati su regole . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27

2.2.1 Regole di Decisione . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27

2.2.2 Decision Sets . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28

2.2.3 Decision List . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28

2.3 Algoritmi di Decision List Learning . . . . . . . . . . . . . . . . . . . . . . . . . 29

2.3.1 Sequential Covering . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29

2.3.2 Algoritmo Rule-Fit . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33

2.4 Alberi Decisionali Ottimi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34

2.4.1 Global Optimal Sparse Decision Trees (GOSDT, "ghost") . . . . . . . . 35

2.5 Generalized Additive Models (GAM) . . . . . . . . . . . . . . . . . . . . . . . . 44

2.5.1 Explainable Boosting Machine . . . . . . . . . . . . . . . . . . . . . . . 47

2.5.2 Neural Additive Models . . . . . . . . . . . . . . . . . . . . . . . . . . . 49

2.6 Prototype-Based Neural Networks . . . . . . . . . . . . . . . . . . . . . . . . . 50

2.7 Inductive Logic Programming (ILP) . . . . . . . . . . . . . . . . . . . . . . . . 54

2.7.1 ILP system . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 61

2.7.2 Aleph system . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62

3 Modelli neuro-simbolici 65

3.1 Approcci neurosimbolici . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 65

3.1.1 SRL/StarAI . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 69

3.1.2 Neural-Symbolic Learning and Reasoning . . . . . . . . . . . . . . . . . 69

3.1.3 Collective classification . . . . . . . . . . . . . . . . . . . . . . . . . . . 73

3.2 Markov Logic Networks . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 74

3.3 ProbLog . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 77

2 3

INDICE

4 Post-Hoc Explanations 80

4.1 Model Explanation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 81

4.1.1 TREPAN . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 82

4.2 Model Inspection . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 82

4.3 Outcome Explanation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 82

4.3.1 LIME – Local Interpretable Model-Agnostic Explanations . . . . . . . . 83

4.3.2 Submodular Pick . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 88

4.3.3 PredDiff – Prediction Difference . . . . . . . . . . . . . . . . . . . . . . 88

4.4 SHAP . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 89

4.4.1 Introduzione e teoria dei giochi . . . . . . . . . . . . . . . . . . . . . . . 89

4.4.2 SHAP – Shapley Additive exPlanations . . . . . . . . . . . . . . . . . . 91

4.4.3 Kernel Shap . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 96

4.5 Gradient Based Explanation Methods . . . . . . . . . . . . . . . . . . . . . . . 100

4.5.1 Saliency Map . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 101

4.5.2 Grad-CAM – Class Activation Mapping . . . . . . . . . . . . . . . . . . 102

4.5.3 Sanity Checks for Saliency Maps . . . . . . . . . . . . . . . . . . . . . . 104

4.6 Attention . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 105

4.6.1 Meccanismo di attention . . . . . . . . . . . . . . . . . . . . . . . . . . . 106

4.6.2 Similarità tra query e keys . . . . . . . . . . . . . . . . . . . . . . . . . . 109

4.6.3 L’attention è una spiegazione? . . . . . . . . . . . . . . . . . . . . . . . 109

4.7 Metodi basati sulla variazione delle feature . . . . . . . . . . . . . . . . . . . . 110

4.7.1 Ceteris Paribus Plots . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 110

4.7.2 Individual Conditional Expectation (ICE) . . . . . . . . . . . . . . . . . 113

4.7.3 Partial Dependence Plots . . . . . . . . . . . . . . . . . . . . . . . . . . 114

4.7.4 Permutation Feature Importance . . . . . . . . . . . . . . . . . . . . . . 116

5 Concept-Based Models 118

5.1 Concept Bottleneck Models . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 118

Capitolo 1

INTRODUZIONE E CONCETTI

GENERALI

Supponiamo di raggiungere una risposta corretta, ottenuta però attraverso un procedimento

errato (effetto Clever Hans). Se riuscissimo a comprendere il motivo per cui vengono fornite

determinate risposte, una volta identificato l’errore di procedimento/ragionamento sottostante,

potremmo intervenire per correggere il processo cognitivo e favorire un miglioramento progressivo

delle prestazioni.

L’XAI cerca di risolvere queste questioni, volendo darle una definizione:

L’explainable artificial intelligence (XAI) esplora e studia metodi per produrre o integrare

modelli di IA, al fine di rendere accessibile e interpretabile la logica interna e il risultato degli

algoritmi, rendendo tale processo comprensibile all’essere umano.

Black-Box models

Le Black-Box(BB) sono sistemi computazionali complessi che, dato un input, producono

un output attraverso un insieme di operazioni matematiche estremamente articolate, spesso

composte da miliardi di calcoli interni non direttamente interpretabili dall’esterno.

Cosa potrebbe permetterci di fare allora XAI?

1. Mi permette di capire perché il modello classifica un certo esempio in un modo specifico

(positivo o negativo), cioè quali fattori hanno guidato la decisione dell’AI.

4 5

Capitolo 1. Introduzione e Concetti Generali

2. Permette di migliorare i modelli: analizzando le spiegazioni posso individuare dove il

sistema commette errori o su quali caratteristiche si basa in modo scorretto. Una volta

identificato il problema, utilizzo questo feedback per correggere il modello (ad esempio

modificando i dati, le feature o l’architettura) e migliorarne le prestazioni. In questo

senso, la spiegazione diventa un vero e proprio meccanismo di feedback per ottimizzare il

sistema.

3. Ci permette di costruire sistemi di Intelligenza Artificiale affidabili e degni di fiducia:

comprendere come il modello prende decisioni aumenta la fiducia dell’utente nel sistema.

Inoltre, la trasparenza permette di verificare se il sistema rispetta determinate regole,

vincoli normativi e requisiti tecnici, e di valutare la sua robustezza rispetto a errori o

attacchi malevoli.

The alignment problem

Alla base di questo ragionamento c’è il problema dell’allineamento. Se utilizziamo un sistema di

intelligenza artificiale per raggiungere i nostri scopi, ma non possiamo intervenire efficacemente

sul suo funzionamento interno, stiamo di fatto delegando una parte della responsabilità decisio-

nale. Proprio per questo è fondamentale che gli obiettivi del sistema coincidano realmente con i

nostri valori e le nostre intenzioni. 6

Capitolo 1. Introduzione e Concetti Generali

Il problema dell’allineamento è evidente nei LLM. Sono modelli molto potenti e capaci di

risolvere diversi task, ma il loro obiettivo di base è puramente statistico: predire la parola

successiva minimizzando un errore matematico. Non c’è nella funzione obiettivo alcuna garanzia

intrinseca di equità, etica o beneficio per l’essere umano. Esistono tecniche di raffinamento

(come fine-tuning o RLHF), ma l’allineamento non è una proprietà naturale del modello: è

qualcosa che viene aggiunto dopo.

Rischi e pericoli nell’(ab)uso dell’IA

Riportiamo alcuni esempi di problematiche e casi di applicazioni dell’XAI:

1. Richiesta di mutuo: Le banche spesso hanno dataset storici con tantissimi clienti, dove per

ogni pratica di mutuo registrano: feature del cliente (reddito, contratto, età, debiti, storico

creditizio, ecc.) e la ground truth / etichetta: ad esempio mutuo concesso oppure mutuo

rifiutato (o anche rimborso regolare vs default). Con questi dati si può addestrare un

modello di classificazione supervisionata che, dato un nuovo cliente, predice se concedere

o no il mutuo (o la probabilità di rischio).

Questa metodologia scaturisce due tipi di problemi:

Ambito Legale: Nell’UE un consumatore non può essere soggetto a una decisione

(a) completamente automatizzata senza garanzie. Il cliente ha diritto a sapere che la

decisione è presa da un algoritmo e a ricevere una spiegazione sui criteri che hanno

portato a quell’esito, oltre a poter richiedere l’intervento umano. Per questo la

spiegabilità è un requisito fondamentale, non solo tecnico ma anche giuridico.

• GDPR: garantisce diritti alle persone quando sono soggette a decisioni automa-

tizzate. L’interessato deve ricevere informazioni chiare sul trattamento dei dati,

può richiedere l’intervento umano, esprimere il proprio punto di vista e ottenere

una spiegazione della decisione.

• AI ACT: classifica i sistemi di intelligenza artificiale in base al livello di rischio.

Per i sistemi ad alto rischio richiede trasparenza, adeguata documentazione,

supervisione umana e output interpretabili accompagnati da istruzioni chiare e

comprensibili. 7

Capitolo 1. Introduzione e Concetti Generali

(b) Ambito Tecnico: il problema nasce dal bias presente nei dati storici. Se un modello

viene addestrato su decisioni passate, ad esempio concessione o rifiuto di prestiti,

impara quella stessa logica, inclusi eventuali squilibri legati a reddito, contesto

familiare o etnia. Quando il modello viene utilizzato per nuove decisioni, tende a

replicare quei pattern: chi è stato penalizzato in passato rischia di esserlo di nuovo,

e chi è stato favorito continua a esserlo. In questo modo si crea un feedback loop,

perché le nuove decisioni alimentano dati che confermano il modello stesso. Un

meccanismo simile può verificarsi nelle ammissioni universitarie: se certi gruppi

sono stati storicamente esclusi, il sistema può finire per rafforzare e polarizzare

ulteriormente quelle disparità.

2. Un esempio è COMPAS: il sistema di valutazione del rischio di recidiva. Il modello calcola

una soglia di rischio usando dati storici che possono contenere bias legati a classe sociale,

provenienza o proxy dell’etnia, finendo per penalizzare sistematicamente certi gruppi.

Il fatto che il modello abbia “imparato” quel pattern non significa che sia giusto o

causale: significa solo che è presente nei dati. Una correlazione nei dati non può essere

usata automaticamente come criterio decisionale, soprattutto se riflette distorsioni sociali

preesistenti.

3. Immaginiamo un’IA che stima il rischio clinico nei pazienti con polmonite. Dai dati storici

può emergere una regola per cui i pazienti asmatici sembrano avere un rischio minore di

complicazioni.

È un risultato controintuitivo: l’asma dovrebbe aumentare il rischio. Il motivo è che, nella

pratica, gli asmatici vengono spesso ricoverati subito in terapia intensiva e ricevono cure

più rapide, riducendo gli esiti gravi osservati nei dati.

Quindi il modello non sta imparando che “l’asma protegge”, ma sta catturando l’effetto

delle decisioni mediche. Senza quell’intervento precoce, il rischio sarebbe più alto. Questo

mostra come l’IA possa confondere correlazione e causalità e perché la spiegabilità (XAI)

sia fondamentale. 8

Capitolo 1. Introduzione e Concetti Generali

4. I modelli “a scatola nera” possono essere ingannati tramite esempi avversari: input

modificati apposta per far sbagliare il modello.

L’idea è che si parte da un’immagine correttamente classificata e si aggiunge una piccola

perturbazione (rumore) quasi impercettibile per l’essere umano. Per noi l’immagine resta

praticamente identica, ma per il modello quella variazione può spostare la decisione e

portarlo a classificare in modo errato. Di conseguenza se abbiamo conoscenza del processo

decisionale possiamo difenderci da questi attacchi.

Bias dei dati

Parlando in generale di bias, si tratta di una forma di polarizzazione sistematica nelle decisioni

del modello. Il sistema può sviluppare una “direzione” preferenziale che non riflette fedelmente

la distribuzione reale o il fenomeno che vogliamo modellare. Questo può accadere perché il

modello è influenzato da variabili implicite, correlazioni nascoste o fattori che non avevamo

considerato rilevanti. In sostanza, il bias porta il modello a prendere decisioni distorte rispetto

alla realtà, spesso amplificando squilibri già presenti nei dati.

Nel lavoro di Ribeiro et al., “Why Should I Trust You?” viene mostrato un esempio di

classificazione tra due specie, ad esempio lupo e husky.

Quando si chiede al modello perché abbia classificato un’immagine in un certo modo, il

metodo di spiegazione (LIME) evidenzia le parti dell’immagine che hanno pesato di più nella

decisione.

Il risultato sorprendente è che il modello non sta guardando l’animale in sé, ma la neve sullo

sfondo. In pratica, classifica come “lupo” le immagini con neve e come “husky” quelle senza.

Questo accade perché nel dataset di addestramento c’era un bias: le immagini dei lupi erano

quasi sempre in ambienti innevati, mentre quelle degli husky no.

Il modello quindi non ha imparato la differenza tra le due specie, ma ha sfruttato una

correlazione spuriosa presente nei dati. Questo è un esempio classico di bias dovuto al dataset.

Un esempio famoso riguarda grandi dataset di immagini raccolti prevalentemente nel mondo

occidentale (dataset Images). Se un modello viene addestrato su dati di questo tipo, finisce per

associare certi concetti a rappresentazioni tipicamente occidentali. 9

Capitolo 1. Introduzione e Concetti Generali

Ad esempio, in correlazione a “matrimonio” potrebbe riconoscere solo immagini di sposi in

abito bianco in una chiesa, ma non essere in grado di identificare correttamente matrimoni con

abiti, rituali o contesti culturali diversi e questa è una mancanza importante.

Un esempio è quello delle piattaforme di lavoro: se i dati storici sono sbilanciati, l’algoritmo

può mostrare a una donna soprattutto lavori meno qualificati o meno pagati, replicando

disuguaglianze esistenti. Allo stesso modo, nei social e nelle notizie vediamo contenuti che

confermano le nostre preferenze, creando una “bolla” informativa. Se contengono bias, questi

sistemi non si limitano a rifletterli, ma possono amplificarli, con effetti socialmente dannosi.

Un altro esempio riguarda il dataset Pascal VOC. Utilizzando una rete di salienza, si può

osservare quali parti dell’immagine il modello usa per classificare, ad esempio, un cavallo. In

alcuni casi emerge che il modello si concentra su un dettaglio specifico (una sorta di “tag” o

regione ricorrente) invece che sull’intera forma dell’animale. Se quella stessa porzione viene

inserita in un’altra immagine che non contiene un cavallo, il modello può comunque classificarla

come “cavallo”. Questo accade perché durante il training ha associato quel particolare pattern

alla classe, dimostrando di aver imparato una correlazione superficiale piuttosto che il concetto

reale dell’oggetto.

Interpretability vs. Explainability

Un modello è quando il suo funzionamento è comprensibile per costruzione. In

interpretabile

questi casi non è necessario aggiungere meccanismi esterni di spiegazione, perché il processo

decisionale è già trasparente nella struttura del modello stesso.

• Alberi decisionali: sono modelli interpretabili perché forniscono regole di classificazione

esplicite, organizzate dalla radice alle foglie. Seguendo il percorso decisionale, è possibile

comprendere il risultato finale attraverso una sequenza di condizioni congiunte. La logica

10

Capitolo 1. Introduzione e Concetti Generali

sottostante è basata su regole if–then che risultano intuitive e facilmente comprensibili

per l’essere umano;

• Modelli lineari generalizzati;

• Sistemi basati su regole (liste, insiemi); Y

• Ragionamento controfattuale: analizza cosa accadrebbe a se modificassimo una variabile

X. È legato ai modelli causali perché studia l’effetto di un intervento, non solo una semplice

correlazione.

• Programmazione logica induttiva.

Il problema è che, pur essendo interpretabili, questi modelli spesso non sono molto accurati.

Esiste quindi un trade-off tra interpretabilità e accuratezza.

Non è sempre così in realtà: a volte i modelli interpretabili sono anche accurati e, in questi

casi, dovrebbero essere preferiti. Un modello black-box andrebbe utilizzato solo quando è

realmente necessario o quando è l’unica opzione disponibile, ad esempio nel caso di un sistema

Anteprima
Vedrai una selezione di 20 pagine su 121
Appunti completi Explainable artificial intelligence  Pag. 1 Appunti completi Explainable artificial intelligence  Pag. 2
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 6
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 11
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 16
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 21
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 26
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 31
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 36
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 41
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 46
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 51
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 56
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 61
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 66
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 71
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 76
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 81
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 86
Anteprima di 20 pagg. su 121.
Scarica il documento per vederlo tutto.
Appunti completi Explainable artificial intelligence  Pag. 91
1 su 121
D/illustrazione/soddisfatti o rimborsati
Acquista con carta o PayPal
Scarica i documenti tutte le volte che vuoi
Dettagli
SSD
Scienze matematiche e informatiche INF/01 Informatica

I contenuti di questa pagina costituiscono rielaborazioni personali del Publisher malatactu di informazioni apprese con la frequenza delle lezioni di Explainable artificial intelligence e studio autonomo di eventuali libri di riferimento in preparazione dell'esame finale o della tesi. Non devono intendersi come materiale ufficiale dell'università Università degli Studi di Firenze o del prof Lippi Marco.
Appunti correlati Invia appunti e guadagna

Domande e risposte

Hai bisogno di aiuto?
Chiedi alla community