Estratto del documento

Cluster analysis

Cos'è un cluster?

Con il termine inglese “cluster” (che significa “grappolo” e a momenti capirete il perché) si indica, generalmente, un gruppo che può essere composto da una serie di elementi, di solito, molto omogenei tra loro. Un gruppo, in quanto omogeneo, è caratterizzato da variabili comuni che permettono di includerli sotto un unico comune denominatore (sesso, età, altezza, peso, temperatura, pressione, etc.). Tali variabili possono essere misurate tramite scale metriche e non metriche.

  • Quantitative: Le prime fanno riferimento a misure come temperatura, distanza, etc.
  • Qualitative: Le seconde fanno riferimento a misure come preferenze, affidabilità, bellezza, etc.

Avendo a disposizione un certo numero di objects, cioè dati caratterizzati da una serie di caratteristiche, l’obiettivo è selezionare una partizione in k gruppi, tali che gli oggetti appartenenti a un gruppo siano vicini e quelli appartenenti a gruppi diversi siano lontani. Questa analisi, che vi premetto sarà essenziale per la realizzazione di numerosissimi studi, viene definita Cluster Analysis.

Più precisamente

La Cluster Analysis è un metodo statistico per l’elaborazione di dati che consente di raggruppare individui o oggetti con caratteristiche simili, sulla base di parametri specifici prestabiliti (come quelli appena citati). Si tratta quindi di un modo per organizzare o classificare i dati all’interno di strutture omogenee così da facilitarne la comprensione. N.B. Il concetto di vicinanza e lontananza citato prima, fa riferimento semplicemente alla similarità di tali objects.

Ad esempio: se in un gruppo sono presenti tutte le persone che sono alte 180 cm e hanno le scarpe azzurre, allora è facile dire che una persona bionda e alta 160 cm con capelli verdi ha ben poco che spartire con loro e quindi questi ultimi, rispetto ai precedenti, sono lontani, anzi, lontanissimi.

Step della Cluster Analysis

Bene, una volta capito ciò, passiamo a definire gli step della Cluster Analysis. Dato un gruppo di dati:

  1. Si definiscono il numero di k-gruppi.
  2. Si assegna, seguendo un preciso metodo, ciascun object in un preciso gruppo sulla base di somiglianze e omogeneità. A tale scopo vengono sfruttati algoritmi di classificazione sempre più complessi sotto il profilo informatico, ma anche sempre più performanti per estrarre informazioni utili dai dati mediante un’accurata e puntuale classificazione.

Dove viene trattato?

  • Marketing e pubblicità online: Identificare i clienti che hanno maggiori probabilità di rispondere al tuo prodotto e al suo marketing è un problema di classificazione molto comune in questi giorni. Gli algoritmi di clustering vengono utilizzati per classificare vari clienti in base ai loro interessi, il che aiuta con un marketing mirato.
  • Analisi del contenuto: Gli algoritmi di clustering vengono utilizzati per classificare i contenuti in base a vari fattori come termini chiave, fonti e argomenti. Molti motori di ricerca e servizi di ricerca personalizzati utilizzano algoritmi di clustering per classificare documenti e contenuti in base alle relative categorie e termini di ricerca.
  • Identificazione di notizie false: Internet è pieno di fake news e consigli. Questi fatti falsi non solo sono fuorvianti, ma possono anche essere pericolosi per molte persone. Gli algoritmi di clustering sono utili per abbinare notizie, fatti e consigli con fonti verificate e classificarli come verità, mezze verità e bugie.
  • Filtri antispam: I filtri antispam sono esempi classici di modelli di classificazione. Classificano e-mail e messaggi come importanti e spam, in base al contenuto al loro interno. Hanno utilizzato l'indirizzo del mittente, i termini chiave all'interno del messaggio e altri fattori per identificare quale messaggio è spam e quale no.

Chiaramente gli esempi non finiscono qui, ma questo basta per comprendere l’importanza di questo argomento.

Clustering Crisp e Clustering Fuzzy

Il clustering fuzzy è una forma di clustering in cui ogni punto dati può appartenere a più di un cluster. Ad esempio, una mela può essere rossa o verde (raggruppamento duro), ma una mela può anche essere rossa e verde (raggruppamento fuzzy). Qui, la mela può essere rossa in una certa misura così come verde in una certa misura. Invece della mela che appartiene al verde [verde = 1] e non al rosso [rosso = 0], la mela può appartenere al verde [verde = 0,5] e al rosso [rosso = 0,5]. Questi valori sono normalizzati tra 0 e 1.

A tal proposito viene introdotto il concetto di “grado di appartenenza”, dove, mediante una funzione, è...

Anteprima
Vedrai una selezione di 4 pagine su 11
Cluster Analysis Pag. 1 Cluster Analysis Pag. 2
Anteprima di 4 pagg. su 11.
Scarica il documento per vederlo tutto.
Cluster Analysis Pag. 6
Anteprima di 4 pagg. su 11.
Scarica il documento per vederlo tutto.
Cluster Analysis Pag. 11
1 su 11
D/illustrazione/soddisfatti o rimborsati
Acquista con carta o PayPal
Scarica i documenti tutte le volte che vuoi
Dettagli
SSD
Scienze economiche e statistiche SECS-S/01 Statistica

I contenuti di questa pagina costituiscono rielaborazioni personali del Publisher Cristian.Cuffaro di informazioni apprese con la frequenza delle lezioni di Statistica avanzata e studio autonomo di eventuali libri di riferimento in preparazione dell'esame finale o della tesi. Non devono intendersi come materiale ufficiale dell'università Università degli Studi di Palermo o del prof Lombardo Alberto.
Appunti correlati Invia appunti e guadagna

Domande e risposte

Hai bisogno di aiuto?
Chiedi alla community