EXPLAINABLE ARTIFICIAL INTELLIGENCE
18 giugno 2026
INDICE
1 Introduzione e Concetti Generali 4
1.1 Evaluation Explainability . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
1.1.1 Evaluating explainability . . . . . . . . . . . . . . . . . . . . . . . . . . 12
1.1.2 Model Parameter Randomization Check . . . . . . . . . . . . . . . . . . 14
1.1.3 Incremental Feature Deletion . . . . . . . . . . . . . . . . . . . . . . . . 14
1.2 Bias e Fairness . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
1.2.1 Bias . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16
1.2.2 Paradosso di Simpson . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16
1.2.3 Bias negli Algoritmi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
1.3 Fairness . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
1.4 Data Visualization . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
2 Modelli Interpretabili 24
2.1 Alberi di Decisione . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
2.1.1 Criteri di splitting: entropia e Gini Index . . . . . . . . . . . . . . . . . 25
2.2 Modelli basati su regole . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
2.2.1 Regole di Decisione . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
2.2.2 Decision Sets . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
2.2.3 Decision List . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
2.3 Algoritmi di Decision List Learning . . . . . . . . . . . . . . . . . . . . . . . . . 29
2.3.1 Sequential Covering . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29
2.3.2 Algoritmo Rule-Fit . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33
2.4 Alberi Decisionali Ottimi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34
2.4.1 Global Optimal Sparse Decision Trees (GOSDT, "ghost") . . . . . . . . 35
2.5 Generalized Additive Models (GAM) . . . . . . . . . . . . . . . . . . . . . . . . 44
2.5.1 Explainable Boosting Machine . . . . . . . . . . . . . . . . . . . . . . . 47
2.5.2 Neural Additive Models . . . . . . . . . . . . . . . . . . . . . . . . . . . 49
2.6 Prototype-Based Neural Networks . . . . . . . . . . . . . . . . . . . . . . . . . 50
2.7 Inductive Logic Programming (ILP) . . . . . . . . . . . . . . . . . . . . . . . . 54
2.7.1 ILP system . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 61
2.7.2 Aleph system . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
3 Modelli neuro-simbolici 65
3.1 Approcci neurosimbolici . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 65
3.1.1 SRL/StarAI . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 69
3.1.2 Neural-Symbolic Learning and Reasoning . . . . . . . . . . . . . . . . . 69
3.1.3 Collective classification . . . . . . . . . . . . . . . . . . . . . . . . . . . 73
3.2 Markov Logic Networks . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 74
3.3 ProbLog . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 77
2 3
INDICE
4 Post-Hoc Explanations 80
4.1 Model Explanation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 81
4.1.1 TREPAN . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 82
4.2 Model Inspection . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 82
4.3 Outcome Explanation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 82
4.3.1 LIME – Local Interpretable Model-Agnostic Explanations . . . . . . . . 83
4.3.2 Submodular Pick . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 88
4.3.3 PredDiff – Prediction Difference . . . . . . . . . . . . . . . . . . . . . . 88
4.4 SHAP . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 89
4.4.1 Introduzione e teoria dei giochi . . . . . . . . . . . . . . . . . . . . . . . 89
4.4.2 SHAP – Shapley Additive exPlanations . . . . . . . . . . . . . . . . . . 91
4.4.3 Kernel Shap . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 96
4.5 Gradient Based Explanation Methods . . . . . . . . . . . . . . . . . . . . . . . 100
4.5.1 Saliency Map . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 101
4.5.2 Grad-CAM – Class Activation Mapping . . . . . . . . . . . . . . . . . . 102
4.5.3 Sanity Checks for Saliency Maps . . . . . . . . . . . . . . . . . . . . . . 104
4.6 Attention . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 105
4.6.1 Meccanismo di attention . . . . . . . . . . . . . . . . . . . . . . . . . . . 106
4.6.2 Similarità tra query e keys . . . . . . . . . . . . . . . . . . . . . . . . . . 109
4.6.3 L’attention è una spiegazione? . . . . . . . . . . . . . . . . . . . . . . . 109
4.7 Metodi basati sulla variazione delle feature . . . . . . . . . . . . . . . . . . . . 110
4.7.1 Ceteris Paribus Plots . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 110
4.7.2 Individual Conditional Expectation (ICE) . . . . . . . . . . . . . . . . . 113
4.7.3 Partial Dependence Plots . . . . . . . . . . . . . . . . . . . . . . . . . . 114
4.7.4 Permutation Feature Importance . . . . . . . . . . . . . . . . . . . . . . 116
5 Concept-Based Models 118
5.1 Concept Bottleneck Models . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 118
Capitolo 1
INTRODUZIONE E CONCETTI
GENERALI
Supponiamo di raggiungere una risposta corretta, ottenuta però attraverso un procedimento
errato (effetto Clever Hans). Se riuscissimo a comprendere il motivo per cui vengono fornite
determinate risposte, una volta identificato l’errore di procedimento/ragionamento sottostante,
potremmo intervenire per correggere il processo cognitivo e favorire un miglioramento progressivo
delle prestazioni.
L’XAI cerca di risolvere queste questioni, volendo darle una definizione:
L’explainable artificial intelligence (XAI) esplora e studia metodi per produrre o integrare
modelli di IA, al fine di rendere accessibile e interpretabile la logica interna e il risultato degli
algoritmi, rendendo tale processo comprensibile all’essere umano.
Black-Box models
Le Black-Box(BB) sono sistemi computazionali complessi che, dato un input, producono
un output attraverso un insieme di operazioni matematiche estremamente articolate, spesso
composte da miliardi di calcoli interni non direttamente interpretabili dall’esterno.
Cosa potrebbe permetterci di fare allora XAI?
1. Mi permette di capire perché il modello classifica un certo esempio in un modo specifico
(positivo o negativo), cioè quali fattori hanno guidato la decisione dell’AI.
4 5
Capitolo 1. Introduzione e Concetti Generali
2. Permette di migliorare i modelli: analizzando le spiegazioni posso individuare dove il
sistema commette errori o su quali caratteristiche si basa in modo scorretto. Una volta
identificato il problema, utilizzo questo feedback per correggere il modello (ad esempio
modificando i dati, le feature o l’architettura) e migliorarne le prestazioni. In questo
senso, la spiegazione diventa un vero e proprio meccanismo di feedback per ottimizzare il
sistema.
3. Ci permette di costruire sistemi di Intelligenza Artificiale affidabili e degni di fiducia:
comprendere come il modello prende decisioni aumenta la fiducia dell’utente nel sistema.
Inoltre, la trasparenza permette di verificare se il sistema rispetta determinate regole,
vincoli normativi e requisiti tecnici, e di valutare la sua robustezza rispetto a errori o
attacchi malevoli.
The alignment problem
Alla base di questo ragionamento c’è il problema dell’allineamento. Se utilizziamo un sistema di
intelligenza artificiale per raggiungere i nostri scopi, ma non possiamo intervenire efficacemente
sul suo funzionamento interno, stiamo di fatto delegando una parte della responsabilità decisio-
nale. Proprio per questo è fondamentale che gli obiettivi del sistema coincidano realmente con i
nostri valori e le nostre intenzioni. 6
Capitolo 1. Introduzione e Concetti Generali
Il problema dell’allineamento è evidente nei LLM. Sono modelli molto potenti e capaci di
risolvere diversi task, ma il loro obiettivo di base è puramente statistico: predire la parola
successiva minimizzando un errore matematico. Non c’è nella funzione obiettivo alcuna garanzia
intrinseca di equità, etica o beneficio per l’essere umano. Esistono tecniche di raffinamento
(come fine-tuning o RLHF), ma l’allineamento non è una proprietà naturale del modello: è
qualcosa che viene aggiunto dopo.
Rischi e pericoli nell’(ab)uso dell’IA
Riportiamo alcuni esempi di problematiche e casi di applicazioni dell’XAI:
1. Richiesta di mutuo: Le banche spesso hanno dataset storici con tantissimi clienti, dove per
ogni pratica di mutuo registrano: feature del cliente (reddito, contratto, età, debiti, storico
creditizio, ecc.) e la ground truth / etichetta: ad esempio mutuo concesso oppure mutuo
rifiutato (o anche rimborso regolare vs default). Con questi dati si può addestrare un
modello di classificazione supervisionata che, dato un nuovo cliente, predice se concedere
o no il mutuo (o la probabilità di rischio).
Questa metodologia scaturisce due tipi di problemi:
Ambito Legale: Nell’UE un consumatore non può essere soggetto a una decisione
(a) completamente automatizzata senza garanzie. Il cliente ha diritto a sapere che la
decisione è presa da un algoritmo e a ricevere una spiegazione sui criteri che hanno
portato a quell’esito, oltre a poter richiedere l’intervento umano. Per questo la
spiegabilità è un requisito fondamentale, non solo tecnico ma anche giuridico.
• GDPR: garantisce diritti alle persone quando sono soggette a decisioni automa-
tizzate. L’interessato deve ricevere informazioni chiare sul trattamento dei dati,
può richiedere l’intervento umano, esprimere il proprio punto di vista e ottenere
una spiegazione della decisione.
• AI ACT: classifica i sistemi di intelligenza artificiale in base al livello di rischio.
Per i sistemi ad alto rischio richiede trasparenza, adeguata documentazione,
supervisione umana e output interpretabili accompagnati da istruzioni chiare e
comprensibili. 7
Capitolo 1. Introduzione e Concetti Generali
(b) Ambito Tecnico: il problema nasce dal bias presente nei dati storici. Se un modello
viene addestrato su decisioni passate, ad esempio concessione o rifiuto di prestiti,
impara quella stessa logica, inclusi eventuali squilibri legati a reddito, contesto
familiare o etnia. Quando il modello viene utilizzato per nuove decisioni, tende a
replicare quei pattern: chi è stato penalizzato in passato rischia di esserlo di nuovo,
e chi è stato favorito continua a esserlo. In questo modo si crea un feedback loop,
perché le nuove decisioni alimentano dati che confermano il modello stesso. Un
meccanismo simile può verificarsi nelle ammissioni universitarie: se certi gruppi
sono stati storicamente esclusi, il sistema può finire per rafforzare e polarizzare
ulteriormente quelle disparità.
2. Un esempio è COMPAS: il sistema di valutazione del rischio di recidiva. Il modello calcola
una soglia di rischio usando dati storici che possono contenere bias legati a classe sociale,
provenienza o proxy dell’etnia, finendo per penalizzare sistematicamente certi gruppi.
Il fatto che il modello abbia “imparato” quel pattern non significa che sia giusto o
causale: significa solo che è presente nei dati. Una correlazione nei dati non può essere
usata automaticamente come criterio decisionale, soprattutto se riflette distorsioni sociali
preesistenti.
3. Immaginiamo un’IA che stima il rischio clinico nei pazienti con polmonite. Dai dati storici
può emergere una regola per cui i pazienti asmatici sembrano avere un rischio minore di
complicazioni.
È un risultato controintuitivo: l’asma dovrebbe aumentare il rischio. Il motivo è che, nella
pratica, gli asmatici vengono spesso ricoverati subito in terapia intensiva e ricevono cure
più rapide, riducendo gli esiti gravi osservati nei dati.
Quindi il modello non sta imparando che “l’asma protegge”, ma sta catturando l’effetto
delle decisioni mediche. Senza quell’intervento precoce, il rischio sarebbe più alto. Questo
mostra come l’IA possa confondere correlazione e causalità e perché la spiegabilità (XAI)
sia fondamentale. 8
Capitolo 1. Introduzione e Concetti Generali
4. I modelli “a scatola nera” possono essere ingannati tramite esempi avversari: input
modificati apposta per far sbagliare il modello.
L’idea è che si parte da un’immagine correttamente classificata e si aggiunge una piccola
perturbazione (rumore) quasi impercettibile per l’essere umano. Per noi l’immagine resta
praticamente identica, ma per il modello quella variazione può spostare la decisione e
portarlo a classificare in modo errato. Di conseguenza se abbiamo conoscenza del processo
decisionale possiamo difenderci da questi attacchi.
Bias dei dati
Parlando in generale di bias, si tratta di una forma di polarizzazione sistematica nelle decisioni
del modello. Il sistema può sviluppare una “direzione” preferenziale che non riflette fedelmente
la distribuzione reale o il fenomeno che vogliamo modellare. Questo può accadere perché il
modello è influenzato da variabili implicite, correlazioni nascoste o fattori che non avevamo
considerato rilevanti. In sostanza, il bias porta il modello a prendere decisioni distorte rispetto
alla realtà, spesso amplificando squilibri già presenti nei dati.
Nel lavoro di Ribeiro et al., “Why Should I Trust You?” viene mostrato un esempio di
classificazione tra due specie, ad esempio lupo e husky.
Quando si chiede al modello perché abbia classificato un’immagine in un certo modo, il
metodo di spiegazione (LIME) evidenzia le parti dell’immagine che hanno pesato di più nella
decisione.
Il risultato sorprendente è che il modello non sta guardando l’animale in sé, ma la neve sullo
sfondo. In pratica, classifica come “lupo” le immagini con neve e come “husky” quelle senza.
Questo accade perché nel dataset di addestramento c’era un bias: le immagini dei lupi erano
quasi sempre in ambienti innevati, mentre quelle degli husky no.
Il modello quindi non ha imparato la differenza tra le due specie, ma ha sfruttato una
correlazione spuriosa presente nei dati. Questo è un esempio classico di bias dovuto al dataset.
Un esempio famoso riguarda grandi dataset di immagini raccolti prevalentemente nel mondo
occidentale (dataset Images). Se un modello viene addestrato su dati di questo tipo, finisce per
associare certi concetti a rappresentazioni tipicamente occidentali. 9
Capitolo 1. Introduzione e Concetti Generali
Ad esempio, in correlazione a “matrimonio” potrebbe riconoscere solo immagini di sposi in
abito bianco in una chiesa, ma non essere in grado di identificare correttamente matrimoni con
abiti, rituali o contesti culturali diversi e questa è una mancanza importante.
Un esempio è quello delle piattaforme di lavoro: se i dati storici sono sbilanciati, l’algoritmo
può mostrare a una donna soprattutto lavori meno qualificati o meno pagati, replicando
disuguaglianze esistenti. Allo stesso modo, nei social e nelle notizie vediamo contenuti che
confermano le nostre preferenze, creando una “bolla” informativa. Se contengono bias, questi
sistemi non si limitano a rifletterli, ma possono amplificarli, con effetti socialmente dannosi.
Un altro esempio riguarda il dataset Pascal VOC. Utilizzando una rete di salienza, si può
osservare quali parti dell’immagine il modello usa per classificare, ad esempio, un cavallo. In
alcuni casi emerge che il modello si concentra su un dettaglio specifico (una sorta di “tag” o
regione ricorrente) invece che sull’intera forma dell’animale. Se quella stessa porzione viene
inserita in un’altra immagine che non contiene un cavallo, il modello può comunque classificarla
come “cavallo”. Questo accade perché durante il training ha associato quel particolare pattern
alla classe, dimostrando di aver imparato una correlazione superficiale piuttosto che il concetto
reale dell’oggetto.
Interpretability vs. Explainability
Un modello è quando il suo funzionamento è comprensibile per costruzione. In
interpretabile
questi casi non è necessario aggiungere meccanismi esterni di spiegazione, perché il processo
decisionale è già trasparente nella struttura del modello stesso.
• Alberi decisionali: sono modelli interpretabili perché forniscono regole di classificazione
esplicite, organizzate dalla radice alle foglie. Seguendo il percorso decisionale, è possibile
comprendere il risultato finale attraverso una sequenza di condizioni congiunte. La logica
10
Capitolo 1. Introduzione e Concetti Generali
sottostante è basata su regole if–then che risultano intuitive e facilmente comprensibili
per l’essere umano;
• Modelli lineari generalizzati;
• Sistemi basati su regole (liste, insiemi); Y
• Ragionamento controfattuale: analizza cosa accadrebbe a se modificassimo una variabile
X. È legato ai modelli causali perché studia l’effetto di un intervento, non solo una semplice
correlazione.
• Programmazione logica induttiva.
Il problema è che, pur essendo interpretabili, questi modelli spesso non sono molto accurati.
Esiste quindi un trade-off tra interpretabilità e accuratezza.
Non è sempre così in realtà: a volte i modelli interpretabili sono anche accurati e, in questi
casi, dovrebbero essere preferiti. Un modello black-box andrebbe utilizzato solo quando è
realmente necessario o quando è l’unica opzione disponibile, ad esempio nel caso di un sistema
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
-
Appunti completi Artificial Vision
-
Appunti completi corso Intelligenza Artificiale
-
Business Intelligence - Appunti completi
-
Appunti presi a lezione di Modelli di e-business e business intelligence
- Risolvere un problema di matematica
- Riassumere un testo
- Tradurre una frase
- E molto altro ancora...
Per termini, condizioni e privacy, visita la relativa pagina.