Statistica descrittiva
1 - Introduzione al corso di statistica
La statistica è una disciplina che studia i fenomeni collettivi utilizzando strumenti
quantitativi. Si occupa quindi di tutti quei fenomeni che non possono essere compresi
osservando un singolo caso, ma che richiedono l’analisi di un insieme di manifestazioni
individuali. Un fenomeno collettivo è infatti costituito da eventi, comportamenti o
caratteristiche che riguardano un gruppo di individui o una determinata aggregazione
sociale.Sono esempi di fenomeni collettivi il consumo di un determinato bene in un periodo
di tempo stabilito, il numero di nascite in una popolazione, i flussi migratori tra regioni o tra
paesi, il reddito di un insieme di individui, la percentuale di rifiuti riciclati rispetto al totale
prodotto oppure il peso di un gruppo di persone o di oggetti.Per descrivere in modo
completo un fenomeno statistico si potrebbe effettuare un’indagine totale, cioè osservare
tutte le unità che compongono la popolazione di interesse. Tuttavia, ogni osservazione
comporta un costo di rilevazione, oltre a richiedere tempi lunghi per la raccolta e
l’elaborazione dei dati. Per questo motivo, spesso non è possibile analizzare l’intera
popolazione e si preferisce osservare solo un sottoinsieme, detto campione.Proprio a
causa dei costi e dei tempi elevati, si sono sviluppate le tecniche di campionamento, che,
grazie all’inferenza statistica, permettono di ottenere informazioni attendibili sull’intera
popolazione anche osservando un numero limitato di unità, mantenendo un livello di
affidabilità prefissato. Accanto a queste tecniche si sono affermati anche i censimenti
permanenti, che consentono di aggiornare continuamente i dati sull’intera popolazione
integrando diverse fonti amministrative con indagini specifiche.Lo strumento principale per la
raccolta dei dati è il questionario. Una corretta progettazione del questionario è
fondamentale per ottenere dati coerenti e utilizzabili nella fase successiva di analisi
statistica. Oggi, inoltre, grazie alla grande diffusione di tecnologie come sensori, smartphone
e computer, in molti settori produttivi è disponibile una enorme quantità di dati non strutturati,
chiamati big data.Quando si analizza un fenomeno statistico, si osservano determinate
caratteristiche, dette caratteri statistici, su specifiche unità statistiche. Nell’esempio
riportato nella tabella con cinque individui (Rossi M., Bianchi G., Nicoletti C., Marcelli F.,
Petrone A.), ciascuna riga rappresenta un individuo e per ognuno sono stati rilevati diversi
caratteri: Età, Sesso, Titolo di studio, Attività, Peso (kg) e Punteggio degli esercizi.
Ogni carattere assume per ciascun individuo una determinata modalità. Le modalità
possono essere numeriche, come nel caso dell’Età (32, 39, 46, 28, 51), del Peso (72, 55,
79, 63, 34) e del Punteggio (65, 55, 53, 78, 21), oppure non numeriche, come il Sesso (M,
F), il Titolo di studio (laurea, diploma) e l’Attività (occupato, disoccupato, studente,
casalinga).L’unità statistica è l’elemento su cui vengono osservati i caratteri ed è definita in
Riassunto di Maria Grazia Botta
base al fenomeno studiato. Può essere uno studente, un abbonato alla TV, un’automobile
venduta o un’abitazione. L’insieme di unità statistiche omogenee costituisce un collettivo
statistico o popolazione. Se tutte le unità sono osservabili, il collettivo è detto empirico,
altrimenti è detto teorico. Inoltre, se il numero di unità è limitato, il collettivo è finito,
altrimenti è infinito. Ad esempio, l’insieme delle autovetture che una fabbrica è in grado di
produrre è un collettivo empirico infinito, mentre l’insieme dei potenziali malati di una certa
patologia è un collettivo teorico infinito.I caratteri statistici si distinguono innanzitutto in
quantitativi e qualitativi. Un carattere è quantitativo quando le sue modalità sono espresse
numericamente, mentre è qualitativo quando le modalità non sono numeri. Le modalità di un
carattere devono essere esaustive, cioè coprire tutti i casi possibili, e non sovrapposte.I
caratteri quantitativi possono essere classificati in diversi modi. Possono essere a scala di
intervalli o a scala di rapporti. Nei caratteri a scala di intervalli non esiste uno zero
assoluto, mentre nei caratteri a scala di rapporti sì. Un esempio di carattere a scala di
intervalli è la temperatura in gradi centigradi, perché lo zero è convenzionale e non ha
senso dire che 40°C è il doppio di 20°C. Al contrario, Peso, Reddito, Età e Lunghezza
sono caratteri a scala di rapporti, perché lo zero indica l’assenza della quantità misurata.I
caratteri quantitativi possono anche essere discreti o continui. Un carattere discreto
assume valori che possono essere messi in corrispondenza con i numeri interi, come il
numero di figli, il numero di pezzi prodotti o il voto a un esame. Un carattere continuo
può assumere qualsiasi valore reale all’interno di un intervallo, come il Peso o il
Reddito.Un’ulteriore distinzione riguarda i caratteri quantitativi trasferibili e non trasferibili.
Un carattere è trasferibile se può essere redistribuito tra le unità statistiche senza
modificarne il totale. Il Reddito, ad esempio, può essere distribuito tra i membri di una
famiglia. Non sono invece trasferibili il Peso, l’Età o il Titolo di studio, perché non possono
essere ceduti o scambiati tra individui.I caratteri qualitativi si distinguono in nominali e
ordinali. Un carattere qualitativo è nominale quando le sue modalità possono solo essere
confrontate per uguaglianza o diversità, senza alcun ordine. Esempi di caratteri nominali
sono il Sesso, l’Attività, il Luogo di nascita, lo Stato civile, la Religione e il Colore degli
occhi. Un carattere qualitativo è invece ordinale quando le modalità possono essere
ordinate secondo un criterio. Sono esempi di caratteri ordinali il grado di soddisfazione
(“Poco”, “Abbastanza”, “Molto”), la posizione in una graduatoria o il Titolo di studio
(“Senza titolo”, “Licenza elementare”, “Licenza media”, “Diploma”, “Laurea”, “Dottorato”). In
alcuni casi i caratteri ordinali sono rettilinei, cioè con un inizio e una fine ben definiti, mentre
in altri casi sono ciclici, come la Direzione del vento o il Mese di nascita, in cui l’ultima
modalità è naturalmente collegata alla prima.Quando un carattere quantitativo presenta un
numero molto elevato di modalità, può risultare difficile interpretare i dati. In questi casi si
procede alla suddivisione in classi, che consiste nel raggruppare i valori in intervalli
Riassunto di Maria Grazia Botta
disgiunti. Questa operazione trasforma il carattere quantitativo in un carattere qualitativo
ordinato, permettendo una rappresentazione più sintetica della distribuzione dei dati, anche
se comporta una perdita di informazione. Le classi possono avere uguale o diversa
ampiezza, dove l’ampiezza è data dalla differenza tra estremo superiore ed estremo
inferiore.Nel caso dell’Età in anni compiuti, variabile quantitativa discreta, un esempio di
suddivisione in classi è: da 0 a 5 anni (età prescolare), da 6 a 10 anni (scuola elementare),
da 11 a 14 anni (scuola media), da 15 a 19 anni (scuola superiore), da 20 a 24 anni
(università), da 25 a 30 anni (inserimento nel mondo del lavoro). In questo caso le classi
hanno ampiezza diversa e sono state definite seguendo criteri esterni al carattere, ma
risultano particolarmente significative dal punto di vista interpretativo.Nella costruzione delle
classi è importante che ogni valore del carattere appartenga a una e una sola classe. Per i
caratteri quantitativi continui si utilizzano spesso intervalli aperti a destra e chiusi a
sinistra, come ad esempio: da 130 a 150 (escluso), da 150 a 170 (escluso), da 170 a 190
(escluso). In questo modo un valore come 149,9 rientra nella prima classe, mentre 150,0
rientra nella seconda.
2 - Tecniche di rilevazione statistica
La rilevazione dei fenomeni statistici è il processo attraverso il quale si raccolgono, si
organizzano e si registrano i dati relativi a un fenomeno di interesse, con lo scopo di
descriverne le caratteristiche e analizzarle in modo corretto. La rilevazione può avvenire
tramite un’indagine totale, quando si osservano tutte le unità che compongono la
popolazione, oppure tramite un’indagine campionaria, quando l’osservazione è limitata a
un campione rappresentativo della popolazione stessa.Nella pratica, spesso si preferisce
ricorrere all’indagine campionaria perché consente una riduzione dei tempi e dei costi
necessari per svolgere l’indagine. Inoltre, l’attendibilità delle informazioni ottenute da un
campione può essere misurata e controllata, e la qualità e la quantità delle informazioni
raccolte possono risultare anche superiori rispetto a quelle ottenibili con un’indagine totale. A
differenza delle indagini totali, che possono richiedere tempi di raccolta ed elaborazione
molto lunghi, anche di diversi anni, le indagini campionarie permettono di ottenere risultati in
tempi rapidi. Questo aspetto è particolarmente importante quando, a seguito di variazioni del
fenomeno osservato, è necessario prendere decisioni di intervento, come nel caso della
rilevazione dell’inflazione o dei consumi di un paese, che devono essere monitorati
periodicamente.Un altro vantaggio dell’indagine campionaria riguarda i costi di rilevazione,
che dipendono in larga parte dal numero di unità osservate. Utilizzando un campione, è
possibile contenere le spese entro un budget prefissato. In alcuni casi, inoltre, l’indagine
totale è impossibile perché lo studio del fenomeno comporta la distruzione o il
Riassunto di Maria Grazia Botta
danneggiamento delle unità osservate. Ad esempio, per valutare la durata media di una
batteria elettrica è necessario attendere che la batteria si esaurisca, mentre per verificare
la sicurezza di un autoveicolo occorre effettuare dei crash test, rendendo indispensabile
l’osservazione di un numero limitato di unità.Con l’evoluzione delle tecnologie di rilevazione
e di trasmissione delle informazioni, gli istituti centrali di statistica hanno introdotto i
censimenti permanenti. In Italia, l’ISTAT ha sviluppato questo sistema con l’obiettivo di
integrare e aggiornare i dati ottenuti dalle precedenti indagini censuarie. Con la tornata
censuaria del 2010-2011 si è conclusa la fase dei censimenti generali decennali. A
differenza del passato, i censimenti permanenti non coinvolgono simultaneamente tutti i
cittadini, le imprese e le istituzioni, ma di volta in volta solo campioni rappresentativi.Nel
processo di acquisizione dei dati è possibile distinguere tra rilevazione sperimentale e
rilevazione osservazionale. La rilevazione sperimentale si basa su ipotesi di lavoro
formalizzabili, spesso in termini matematici, e consente allo statistico di controllare le
condizioni in cui l’esperimento si svolge e le caratteristiche delle unità statistiche
utilizzate. Questo tipo di rilevazione è tipico degli esperimenti fisici, chimici, biologici svolti in
laboratorio, di molti esperimenti clinici e di quelli psicologici. In sostanza, la rilevazione
sperimentale implica il controllo e, se necessario, la modificazione del corso naturale degli
eventi.In queste situazioni è fondamentale controllare le variabili rilevanti, dette fattori, che
influenzano il fenomeno osservato. I fattori si distinguono in fattori sperimentali, che
rappresentano l’oggetto principale della ricerca, come diversi trattamenti farmacologici,
differenti tipi di fertilizzante o vari programmi di educazione sanitaria, e fattori di
stratificazione, che riguardano la composizione delle unità sperimentali, come Peso, Età e
Sesso. Per gestire in modo corretto questi fattori si utilizza un disegno sperimentale, che
definisce la metodologia da adottare per esercitare un controllo diretto sulle variabili che
incidono sul fenomeno.Un esempio è lo studio della crescita dei cavalli in relazione a tre
diversi tipi di diete, sapendo che la crescita dipende fortemente dal sesso. In questo caso
la dieta rappresenta il fattore sperimentale, mentre il sesso è il fattore di stratificazione. Il
disegno sperimentale può prevedere la suddivisione dei cavalli in due gruppi, maschi e
femmine, e successivamente la suddivisione di ciascun gruppo in tre sottogruppi, a ciascuno
dei quali viene assegnata una delle tre diete.Nonostante il controllo diretto dei fattori
principali, esistono sempre altri fattori non considerati che possono influenzare i risultati. Per
questo motivo si utilizza un controllo indiretto tramite la randomizzazione, cioè
l’assegnazione casuale delle unità statistiche ai gruppi sperimentali. Un altro esempio
riguarda la sperimentazione di un farmaco contro un tumore, con tre possibili dosaggi
(basso, medio, alto), sapendo che il Peso è un fattore di stratificazione rilevante. In un
campione di 36 cavie, si formano tre gruppi di 12 cavie in base alla classe di peso (basso,
medio, alto) e, all’interno di ciascun gruppo, tre sottogruppi di 4 cavie, ai quali vengono
Riassunto di Maria Grazia Botta
assegnati casualmente i tre dosaggi. La randomizzazione consente di evitare che fattori
estranei, come Età o Sesso, influenzino la risposta al trattamento e garantisce che le
differenze osservate siano attribuibili al fattore sperimentale.La rilevazione osservazionale
comprende invece situazioni in cui lo statistico si limita a osservare il fenomeno senza
modificarne le condizioni. La principale tecnica di rilevazione osservazionale è l’indagine
statistica, il cui obiettivo è acquisire informazioni su una popolazione, intesa come insieme
di unità elementari su cui si manifesta il fenomeno studiato. Anche in questo caso si
distinguono indagini totali e indagini campionarie.Lo svolgimento di un’indagine statistica
richiede una precisa pianificazione. In primo luogo è necessaria la definizione degli
obiettivi, che permette di individuare correttamente la popolazione di riferimento e le unità
statistiche. Una definizione errata degli obiettivi può compromettere seriamente i risultati
dell’indagine. Occorre poi stabilire il periodo di riferimento, cioè l’arco temporale a cui si
riferiscono le informazioni raccolte. In alcune indagini, dette retrospettive, si chiedono
informazioni relative a periodi precedenti, come l’occupazione di tre anni prima o il reddito
dell’anno precedente.Un elemento fondamentale è la lista delle unità statistiche, che
rappresenta l’elenco degli elementi appartenenti alla popolazione ed è lo strumento
principale per selezionare il campione. Tuttavia, in molti casi non esiste una lista affidabile.
Ad esempio, negli Stati Uniti non esiste un’anagrafe generale, mentre in altri casi la
popolazione di interesse è solo parzialmente conosciuta. In queste situazioni si ricorre a
tecniche alternative, come il campionamento areale, che prevede l’estrazione casuale di
piccole aree territoriali, oppure il campione a valanga, utilizzato per popolazioni rare, in cui i
primi soggetti intervistati forniscono i contatti di altri appartenenti alla stessa popolazione.Per
l’acquisizione dei dati, uno strumento centrale è l’intervista, che consiste nel porre domande
alle unità della popolazione e nel registrare le risposte tramite un questionario. Le interviste
possono essere dirette, quando l’intervistatore entra in contatto diretto con l’intervistato,
oppure indirette, quando si utilizza un mezzo di comunicazione come il telefono o la posta
elettronica. Nell’intervista diretta la presenza dell’intervistatore consente di controllare
l’identità del rispondente e di chiarire eventuali dubbi, ma può anche introdurre distorsioni se
l’intervistatore non è adeguatamente formato.Un’altra modalità è l’auto-compilazione, che
può avvenire tramite posta, fax, e-mail o strumenti digitali come il CAWI e il MAWI, in cui il
questionario viene compilato autonomamente dall’intervistato online. Questa tecnica riduce i
costi e l’organizzazione del lavoro sul campo. L’intervista telefonica è molto diffusa,
soprattutto grazie alla telefonia fissa e alla diffusione degli smartphone, anche se può
presentare problemi di copertura e affidabilità degli elenchi telefonici. Tecniche come il CATI
e il CAPI permettono di migliorare la qualità dei dati grazie all’uso di software che guidano
l’intervistatore nella somministrazione del questionario.Una forma particolare di intervista è
l’exit poll, utilizzata per stimare i risultati delle elezioni prima dello spoglio delle schede,
Riassunto di Maria Grazia Botta
intervistando in modo anonimo gli elettori all’uscita dei seggi, selezionati tramite un
campione di seggi elettorali.Oltre agli esperimenti e alle indagini, i dati possono essere
acquisiti da collezioni predisposte da enti o società esterne, come gli istituti nazionali di
statistica. In Italia, l’ISTAT, attivo dal 1926, è l’organo della statistica ufficiale e, insieme agli
altri enti del Sistema Statistico Nazionale (SISTAN), rappresenta la principale fonte di dati
ufficiali. Un’ulteriore fonte è costituita dalle banche dati, che raccolgono grandi quantità di
dati su supporto digitale e ne facilitano la consultazione.Una volta raccolti, i dati vengono
registrati su supporto digitale e sottoposti a un controllo di qualità per verificarne la
coerenza. Vengono individuati errori evidenti, come un medico con licenza elementare o
un bambino di cinque anni coniugato, e valori poco atte
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.