S
tatistica per il business 30/09
Rilevazioni statistiche
La conoscenza delle caratteristiche di un fenomeno avviene attraverso le rilevazioni (totali e
parziali), ma solo sulla base di certe condizioni basilari per la rappresentatività:
totali: per tutte le unità del collettivo;
parziali: solo una parte del collettivo (campione statistico)
Campione rappresentativo: estratto con criterio oggettivo (proprietà di estrazione dei
campioni e non delle unità statistiche).
Il campione è un sottoinsieme della nostra popolazione che affinché mi permetta di giungere a
dei risulti probabili deve essere rappresentativo della popolazioni. Le nostre rilevazioni possono
essere totali o parziali.
M dimensione popolazione;
m dimensione del campione: questo deve essere un rappresentativo della popolazione
(contenga le stesse caratteristiche della popolazione)
In azienda non si usa la varianza ma lo scarto quadratico medio per misurare la variabilità.
Errore di 2 tipo: errore in cui vai a verificare un campione rappresentativo della realtà quando
non lo è. La deduco dell’errore modale e dal sigma.
Più il campione è omogeneo meglio è, più eterogeneità ce più si abbassa la probabilità di
successo nelle deduzione che si fanno.
Pianificazione di un piano di ricerca
• Progettazione = obiettivi, costi, tempi, criteri di rilevazione, piani di campionamento e
caratteristiche dello strumento di rilevazione;
• Rilevazione = operazioni e criteri per la raccolta delle info;
• Registrazione = trasferimento dei dati grezzi;
• Revisione e codifica = verifica e correzione dei dati grezzi;
• Elaborazione = redazione in formato tabellare e grafico delle variabili analizzate;
• Validazione = verifica sulla coerenza interna ed esterna del fenomeno;
• Diffusione = redazione di report statistici pubblici.
Unità statistica è l’oggetto della mia rilevazione, può essere un oggetto ( es. donna), una
fattura, decreti, in pratica è un documento che io devo studiare per decidere se è coerente.
FASI DELLA RICERCA
1.preliminare : definizione del tema e dei sottotemi;
ricerche bibliografiche sul tema (approfondimenti sul tema e trattazioni scientifiche già
svolte);
definizione delle domande: (scelta di alcune domande inerenti al tema e ai sottotemi da
trattare) attraverso ricognizione dell'ambiente (contatti diretti al fine di ottenere nuove
conoscenze) e indagine pilota (sperimentazione preliminare di una indagine su pochi elementi
del collettivo)
formulazione delle ipotesi: possibili risposte che si possono dare ad ognuno dei quesiti posti
in relazione ai temi e sottotemi.
2. programmazione:
modalità di rilevazione : criteri di rilevazione delle unità statistiche attraverso l'esame di
documenti (per dati già esistenti), interviste (dirette, postali e telefoniche, ciò dipende dalle
caratteristiche principali che devono soddisfare le indagini) dirette e indirette (questionario
tramite intervistatore e postale).
• L'intervista postale ha due pregi: costo basso e comodità nelle risposte; difetti sono legati
alla possibilità di rispedizione, compilazione fatta da altri;
• L'intervista telefonica: questionario breve e non risposte alla casualità delle scelte (non tutti
hanno il telefono)
• Metodo del sopralluogo: consiste nel mandare un osservatore al fine di monitorare il
comportamento in risposta dei soggetti;
• Metodo del libretto o panel: si tratta di indagini di tipo continuativo, crea problemi di
distorsione al campionamento delle unità da intervistare;
Verifica degli strumenti di relazione dei dati: si effettua un collaudo del questionario (o di
altro strumento) per verificarne l' idoneità; somministrazione a un campione ristretto di
elementi (anche se non rappresentativo del collettivo di indagine); avviene tramite interviste
(domande più complesse); correzione ed eventuale riverifica; somministrazione dopo la verifica
di positività;
Norme per il rilevatore: formazione mirata per l'istruzione dei rilevatori e simulazioni ad hoc;
Norme per informare l'intervistato: informazioni introduttive sugli obiettivi dell'intervista, l'
Ente che svolgerà la rilevazione e gli scopo, riservatezza nei dati, conformità alla legge sulla
privacy, fini scientifici e/o di mercato, attraverso mass media;
Previsione dei costi e dei tempi: equipe di ricerca, intervistatori, addetti allo spoglio,
elaborazione dati, mezzi di trasporto, costo preparatori per l' intervista formazione in aula)
3. IL QUESTIONARIO
Difficoltà legate alle domande (il modo come si pongono dipende l' attendibilità delle risposte);
Fase di preparazione: approfondimenti bibliografici, rapporti di collaborazione dei
responsabili di ciascuno stadio dell'inchiesta ;
Le domande devono rispettare i seguenti criteri:
• evitare che l'intervistato faccia sforzi di memoria;
• domande imbarazzanti;
• semplificate sino ad un linguaggio elementare;
• scelta sul numero delle domande;
• ordinamento delle domande (pre-informazioni e opinioni iniziali - domande difficili pur
semplificate- persona dell'intervistato - domande supplementari (servono per suscitare
interesse e a far procedere agevolmente il colloquio) - domande filtro (si tratta di domande
meno dirette alla questione pur sempre attinenti) - domande chiuse o strutturate (inserire le
risposte contrarie)
NORME PER GLI INTERVISTATORI
•Deve interrogare esattamente le persone indicate sul piano di lavoro;
•Conoscenza adeguata dei contenuti;
lon influenzare le risposte e riportare (se l'intervista è libera tutt mmenti dell' intervistato
•Insistere in qualche modo sull'intervista;
•Evitare i suggerimenti;
•Deve avere una buona cultura, modi distinti anche con simpatia .
Se parlo di campione parlo di statistiche campionarie, se parlo di popolazione parlo di
parametri. Le statistiche campionarie devono tendere ad eguagliare i parametri della
popolazione
Statística descrittíva - inferenziale
• statistica descrittiva = si " limita" descrivere le leggi che regolano il fenomeno
limitatamente all' insieme considerato
• statistica inferenziale= permette, partendo dall'analisi del solo campione (B) e assumendo
certe ipotesi sullo stesso, di generalizzare i risultati ottenuti all' intera popolazione (A) da cui il
campione è estratto
Es. EXIT-POOL
Fornisce le stime dei risultati delle elezioni prima dello spoglio delle schede elettorali.
L'indagine s volge intervistando, in forma anonima, le persone che escono dai seggi elettorali,
dopo le operazioni o generalizzano, per mezzo di processi infrenziali, a tutti (popolazione) i
seggi.
Vantaggi dell'indagine campionaria
• L'estrazione di un campione, rispetto ad un censimento completo della popolazione, richiede:
- meno tempo
- meno costi
•L' attendibilità delle informazioni ottenibili da un campione puc essere "misurata" e controllata
•Un campione è più "pratico" da gestire rispetto ad un
censimento completo della popolazione.
Il p value è la probabilità di errore minimo che posso
ottenere nelle valutazione fatte. Quando nella realtà è
falso.
Questa probabilità può variare per valori compresi tra
0 e 1
1/10 lezione 2 ( slide 1)
Con questa slide mettiamo in evidenza come si stimano le diverse questioni campionarie.
Nella seconda funzione siccome abbiamo N grande e sigma conosciamo le sue caratteristiche
per dimensioni e le caratteristiche per la misura della variabilità.
-E epslon (il valore al denominatore) è il margine d’errore che si può tollerare e viene deciso
dall’analista.
-Z rappresenta il valore critico della distribuzione normale standardizzata in corrispondenza al
valore dell’errore alpha. Cioè rappresenta sull’asse delle x i limiti/ valori critici. L'integrale che
va da – z a + z rappresenta l’area sottesa alla curva come misure di probabilità di successo
dell’evento. Più si allargano i valori critici più si allarga la probabilità di successo.
Sulla base che io non conosco nulla della popolazione calcolo l’ampiezza campionaria
benulliana.
La 3 formula: se si è in possesso di una partizione in proporzione legata alla variabile oggetto
di osservazione posso utilizzare una dimensione campionaria per frequenze relative.
In alternativa se piuttosto di conoscere la proporzione (p) conoscessi il numero in valore
assoluto di soggetti che nell’ambito della clientela potenziale consumano il nostro prodotto,
viene rappresentata con n con 0 ( n0) come nella terza formula.
La dimensione del campione e funzione di vari aspetti. Importante
L’n piccolo dipende: da N,( se ce li ho) dalla varianza, dalla variabilità del campione la dove
esso lo abbia strutturato i modo rappresentativo, dell’errore(epslon), dipende dal nostro alpha.
Se la variabilità è alta devo avere n piu grande perché ho tanta eterogeneità quindi ho
bisogno di avere una dimensione campionaria quanta piu alta possibile; Se ho una variabilità
bassa si userà n piu piccolo in quanto ci avviciniamo all’omogeneità.
In base anche a come cambio il mio alpha avrò un n differente.
Senza ripetizioni ovvero che se scelgo un numero o persona non si può riscegliere. In pratica
si fa riferimento alla capacità di selezione un’unità statistica e non ripetere la stessa operazione
sulla stessa unità.
TECNICHE DI CAMPIONAMENTO
Le scelte delle unita possono avvenire attraverso un Campionamento casuale semplice o
sistematico
La scelte delle unità avvengono con:
-Campione casuale semplice: occorre conoscere gli elenchi di tutte le unità statistiche
dell'universo; per la composizione occorre che la scelta di tutte le unità statistiche della
popolazione presenti la medesima probabilità di estrazione;
-scelta casuale: non significa senza regole, ma scelte casualmente senza alcuno
condizionamento di n elementi rispetto alla N unità;
N Rappresenta la frazione di campionamento, cioè quanta parte di frazione noi siamo andati a
campionare.
-n rappresenta l'ampiezza campionaria; numeri di elementi /unità che compongono un
campione
- N rappresenta la numerosità della popolazione;
Se il valore medio campionario si avvicina al valore medio della popolazione allora ho un
errore campionario basso. Se invece si discosta allora ho un errore alto.
Più faccio crescere n più questo ha probabilità di assomigliare alle caratteristiche della
popolazione.
L’n piccolo coincide con il valore medio quando coincide con N.
Qualora non si conoscano gli elementi si usa il campionamento sistematico (la scelta dell'unita
da campionare dipende da K)
il rapporto tra n/N rappresenta la frazione di campionamento;
• Quando un campione è scelto in modo casuale la precisione della stima aumenta con
l'aumentare della dimensione del campione.
Precisione della stima: la capacità che assume il campione di rappresentare la realtà.
Più n cresce più ho la capacità di istruire il nostro stimatore S(sigma) che tende verso sigma.
Più cresce la dimensione campionaria più cresce la probabilità di successo che quel campione
si possa dire rappresentativo di quel paese.
Se non ho un elenco il campionamento la tecnica di campionamento da utilizzare è il
campionamento sistematico.
Errore di campionamento: errore sulla caratteristica della popolazione.
Errore di campionamento :L'errore sulle caratteristiche della popolazione; Identifica la
misura dello scostamento che esiste tra quanto rappresentato dalle unità campionarie e quanto
è rappresentato dalla realtà.
Dimensione campionaria sarà: n=(Za/2* N* 52)/[e2*(N-1)+Z-a/2* 52]=
-Campione sistematico: la scelta delle unità da campionare dipende da K (passo di
estrazione) dato da N/n. Se l'elenco degli elementi della popolazione è casuale anche il
campione sistematico rispetterà la casualità.
Esempio : Se ho stabilito la mia dimensione campionaria cioè n piccolo quindi ad esempio devo
scegliere 10 studenti su 150 se utilizziamo il campionamento sistematico significa che è N/n è
uguale a (150/10)=15. Quindi significa che sceglierà il 15esimo, 30esimo (15+15) e così via..
Fino a quando non avrò ottenuto 10 unità che sono pari a n; quindi, fino a quando non ne avrò
scelti 10.
Prima ancora di selezionare le unita è necessario che io devo segmentare il mio campione in
relazione ai segmenti della popolazione.
-Campione a più stadi: per popolazione numerose e per ridurre i costi S programmano i
campioni a più stadi (province = unità primarie, comuni = unità secondarie, imprese o altro =
unità finali).
Più io segmento il mio campione in relazione alla segmentazione coerente della popolazione,
più è probabile che il mio campione segue le caratteristiche della popolazione.
Se la segmentazione che io faccio si ferma a un primo livello di stratificazione questo
campionamento si chiamerà di primo stadio, se io invece oltre a segmentare ad esempio per
spesso comincio a segmentare anche per provenienza o per età avrò una segmentazione di
secondo o anche detta grappolo.
-Campione stratificato: quando la popolazione è numerosa non solo è difficile numerare tutti
gli elementi della popolazione ma si corre il rischio di inserire nel campione elementi atipici.
Esso consiste nel classificare le unità statistiche in un certo numero di classi (strati) da cui
estrarre gli elementi del campione (ogni elemento deve essere casuale e comparire in un solo
strato), Stratificazione proporzionale: ogni strato campionario è proporzionato alla
popolazione di ogni strato. Con n la numerosità delle unità totali campionate date da
n1, n2...ns; con N la numerosità delle unità totali della popolazione; con f la frazione d
campionamento n/N; quindi le unità da campionare in ciascuno strato sono: n1=f*N1,
n2=f*N2.. esso si può applicare solo se conosciamo le unità della popolazione
contenute nello strato.
Lavoriamo sempre con risultati probabili e purtroppo sono soggetto a degli errori. Ad esempio,
errori per quanto riguarda la chiarezza delle domande fatte sul questionario perché possono
generare interpretazioni diverse.
Vantaggi( ha saltato)
-Risparmio di mezzi e tempo;
-Valutazione del campione e del rischio di errore;
- Ottimizzare il numero di controlli da effettuare in
relazione al rischio da tollerare;
-Pervenire a risultati scientificamente controllabili, se le
procedure campionarie sono seguite con rigore
LE FASI DEL CONTROLLO CAMPIONARIO
1. Individuazione dell'oggetto di interesse.
2. Scelta del tipo di campionamento.
3. Scelta delle unità da includere nel campione.
4. Stima della significatività dello stimatore.
5. Interpretazione dei risultati
ERRORI nella rilevazione
•Poca chiarezza delle domande formulate nei
questionari;
• Imprecise definizione dell'universo;
•mancate risposte al questionario;
•suggerimenti ed interpretazioni errate
dell'intervistatore;
•spoglio dei dati (codifiche errate, riporti errati...);
•trascrizioni
ERRORI statistici
•Errore statistico = valore vero - valore disponibile dall'indagine;
•Errore statistico = errori campionari + non campionari;
•Errori non campionari = derivano dalle fasi della progettazione di un piano di ricerca = guida
sulla qualità dei dati;
Più basso è l'alfa, quindi più basso voglio tenere l'errore, più alto deve essere n piccolo.
N piccolo deve tendere sempre verso il più alto possibile, quanto più tendente verso N grande.
Se conoscessi sigma, mi fermerei nella dimensione campionaria quando il mio S tenderebbe
verso il sigma. Più basso è l'alfa, quindi più basso voglio tenere l'errore, più alto deve essere n
piccolo.
N piccolo deve tendere sempre verso il più alto possibile, quanto più tendente verso N grande.
Se conoscessi sigma, mi fermerei nella dimensione campionaria quando il mio s tenderebbe
verso il sigma.
Lezione 9/10
Inferenze su qualità processi produttivi
Parliamo di intervalli di confidenza
Intervalli di confidenza rientrano in quella parte dell'inferenza sta mette a disposizione
dell'analista gli elementi per la stima parametrica; per il calcolo di ciò che potrebbe
probabilisticamente accadere nella popolazione e la verificare le ipotesi
Tecniche di inferenza statistica:
- stima parametrica
- verifica di ipotesi
stima significa che partendo da un dato di panel trovare un'opportuna funzione con una
probabilità di successo 1- alpha mi permette di ottenere dei valori.
Stima dei parametri
I problemi di stima riguardano i metodi tramite cui vengono stimate le caratteristiche di
popolazione utilizzando le informazioni del campione.
Esistono 2 tipi di stime:
- Puntuale: Stimare puntualmente un parametro significa assegnare al parametro
incognito della popolazione un valore calcolato nel campione, con un rischio di errore.
(Stima secca)
- Intervallare: Stimare con intervallo un parametro significa costruire intorno alla stima
puntuale un intervallo entro cui, con un certo grado di fiducia (coefficiente di
confidenza) è compreso il parametro della popolazione. Stima basata su un range di
valori
Le stime fanno riferimento a parametri che sono la media,
moda, scarto quadratico medio….
Se io sto studiando da che cosa dipende il mio fatturato e
il mio
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.