Cluster analysis
Cos'è un cluster?
Con il termine inglese “cluster” (che significa “grappolo” e a momenti capirete il perché) si indica, generalmente, un gruppo che può essere composto da una serie di elementi, di solito, molto omogenei tra loro. Un gruppo, in quanto omogeneo, è caratterizzato da variabili comuni che permettono di includerli sotto un unico comune denominatore (sesso, età, altezza, peso, temperatura, pressione, etc.). Tali variabili possono essere misurate tramite scale metriche e non metriche.
- Quantitative: Le prime fanno riferimento a misure come temperatura, distanza, etc.
- Qualitative: Le seconde fanno riferimento a misure come preferenze, affidabilità, bellezza, etc.
Avendo a disposizione un certo numero di objects, cioè dati caratterizzati da una serie di caratteristiche, l’obiettivo è selezionare una partizione in k gruppi, tali che gli oggetti appartenenti a un gruppo siano vicini e quelli appartenenti a gruppi diversi siano lontani. Questa analisi, che vi premetto sarà essenziale per la realizzazione di numerosissimi studi, viene definita Cluster Analysis.
Più precisamente
La Cluster Analysis è un metodo statistico per l’elaborazione di dati che consente di raggruppare individui o oggetti con caratteristiche simili, sulla base di parametri specifici prestabiliti (come quelli appena citati). Si tratta quindi di un modo per organizzare o classificare i dati all’interno di strutture omogenee così da facilitarne la comprensione. N.B. Il concetto di vicinanza e lontananza citato prima, fa riferimento semplicemente alla similarità di tali objects.
Ad esempio: se in un gruppo sono presenti tutte le persone che sono alte 180 cm e hanno le scarpe azzurre, allora è facile dire che una persona bionda e alta 160 cm con capelli verdi ha ben poco che spartire con loro e quindi questi ultimi, rispetto ai precedenti, sono lontani, anzi, lontanissimi.
Step della Cluster Analysis
Bene, una volta capito ciò, passiamo a definire gli step della Cluster Analysis. Dato un gruppo di dati:
- Si definiscono il numero di k-gruppi.
- Si assegna, seguendo un preciso metodo, ciascun object in un preciso gruppo sulla base di somiglianze e omogeneità. A tale scopo vengono sfruttati algoritmi di classificazione sempre più complessi sotto il profilo informatico, ma anche sempre più performanti per estrarre informazioni utili dai dati mediante un’accurata e puntuale classificazione.
Dove viene trattato?
- Marketing e pubblicità online: Identificare i clienti che hanno maggiori probabilità di rispondere al tuo prodotto e al suo marketing è un problema di classificazione molto comune in questi giorni. Gli algoritmi di clustering vengono utilizzati per classificare vari clienti in base ai loro interessi, il che aiuta con un marketing mirato.
- Analisi del contenuto: Gli algoritmi di clustering vengono utilizzati per classificare i contenuti in base a vari fattori come termini chiave, fonti e argomenti. Molti motori di ricerca e servizi di ricerca personalizzati utilizzano algoritmi di clustering per classificare documenti e contenuti in base alle relative categorie e termini di ricerca.
- Identificazione di notizie false: Internet è pieno di fake news e consigli. Questi fatti falsi non solo sono fuorvianti, ma possono anche essere pericolosi per molte persone. Gli algoritmi di clustering sono utili per abbinare notizie, fatti e consigli con fonti verificate e classificarli come verità, mezze verità e bugie.
- Filtri antispam: I filtri antispam sono esempi classici di modelli di classificazione. Classificano e-mail e messaggi come importanti e spam, in base al contenuto al loro interno. Hanno utilizzato l'indirizzo del mittente, i termini chiave all'interno del messaggio e altri fattori per identificare quale messaggio è spam e quale no.
Chiaramente gli esempi non finiscono qui, ma questo basta per comprendere l’importanza di questo argomento.
Clustering Crisp e Clustering Fuzzy
Il clustering fuzzy è una forma di clustering in cui ogni punto dati può appartenere a più di un cluster. Ad esempio, una mela può essere rossa o verde (raggruppamento duro), ma una mela può anche essere rossa e verde (raggruppamento fuzzy). Qui, la mela può essere rossa in una certa misura così come verde in una certa misura. Invece della mela che appartiene al verde [verde = 1] e non al rosso [rosso = 0], la mela può appartenere al verde [verde = 0,5] e al rosso [rosso = 0,5]. Questi valori sono normalizzati tra 0 e 1.
A tal proposito viene introdotto il concetto di “grado di appartenenza”, dove, mediante una funzione, è...
-
Cluster Analysis
-
Cluster Analysis
-
Cluster Analysis Esercitazione 1 Celiachia
-
Analysis of variance, logistic regression, cluster analysis