Indice
1 Aspetti generali sul campionamento da popolazioni finite 3
1.2 Linee metodologiche essenziali di una rilevazione statistica (cen-
suaria o campionaria): . . . . . . . . . . . . . . . . . . . . . . 3
1.3 Popolazioni, etichette, modalità etichettate . . . . . . . . . . . 4
1.4 Popolazioni suddivise in sottopopolazioni . . . . . . . . . . . . 5
1.5 Liste di unità di campionamento . . . . . . . . . . . . . . . . . 6
1.6 Rilevazioni statistiche e indagini statistiche . . . . . . . . . . . 7
1.7 Fonti di errore e distorsioni . . . . . . . . . . . . . . . . . . . . 7
1.9 Campionamento Non Probabilistico . . . . . . . . . . . . . . . 7
2 Campionamento probabilistico 9
2.1 Definizioni e proprietà di base . . . . . . . . . . . . . . . . . . 9
2.3 Dati campionari etichettati . . . . . . . . . . . . . . . . . . . . 10
2.4 Approcci inferenziali: Modello vs Popolazioni Finite . . . . . . 10
2.5 Stimatori e loro proprietà . . . . . . . . . . . . . . . . . . . . 11
2.6 Intervalli di confidenza . . . . . . . . . . . . . . . . . . . . . . 12
3 Disegno campionario semplice 14
3.1 Disegno semplice senza ripetizione (SSR) . . . . . . . . . . . . 14
3.3 Stima della varianza . . . . . . . . . . . . . . . . . . . . . . . 16
3.4 Approssimazione normale del disegno SSR e intervalli di con-
difenza per la media della popolazione . . . . . . . . . . . . . 17
3.5 Stima di proporzioni . . . . . . . . . . . . . . . . . . . . . . . 17
3.6 Regola di estensione per la stima di parametri lineari . . . . . 18
3.7 Stima di covarianze . . . . . . . . . . . . . . . . . . . . . . . . 19
3.8 Stima di rapporti . . . . . . . . . . . . . . . . . . . . . . . . . 21
3.10 Il disegno semplice con ripetizione SCR . . . . . . . . . . . . . 23
4 Scelta della numerosità campionaria nel campionamento sem-
plice 24
4.2 Scelta della numerosità campionaria per al stima di proporzioni 24
4.3 Scelta della numerosità campionaria per la stima di medie . . 26
5 Stima con il metodo della regressione 27
5.2 Lo stimatore alle differenze . . . . . . . . . . . . . . . . . . . . 27
5.3 Lo stimatore per regressione . . . . . . . . . . . . . . . . . . . 29
6 Stima con il metodo del quoziente 30
6.2 Distorsione e varianza approssimate dello stimatore per quo-
ziente . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
1
6.3 Stima della varianza dello stimatore per quoziente . . . . . . . 32
7 Disegno campionario stratificato 33
7.2 Stima della media di una popolazione . . . . . . . . . . . . . . 34
7.3 Campionamento stratificato proporzionale . . . . . . . . . . . 35
7.4 Disegno stratificato ottimale . . . . . . . . . . . . . . . . . . . 36
7.4.1 Allocazione di Neyman . . . . . . . . . . . . . . . . . . 37
7.5 Scelta della numerosità campionaria . . . . . . . . . . . . . . . 38
8 Post-Stratificazione 39
9 Disegno campionario a grappolo con uguali probabilità di
selezione 42
9.3 Grappoli della stessa dimensione . . . . . . . . . . . . . . . . . 44
9.4 Grappoli di diversa numerosità e stima per quoziente . . . . . 46
10 Disegno campionario sistematico 48
10.1 Differenze e analogie con il disegno SSR . . . . . . . . . . . . . 48
10.2 Stima della media della popolazione . . . . . . . . . . . . . . . 49
10.3 Efficienza di stima con disegno sistematico . . . . . . . . . . . 50
10.4 Stima della varianza della media campionaria . . . . . . . . . 53
11 Disegno campionario a due stadi semplici 54
11.2 Considerazioni sul numero totale di unità elementari . . . . . 55
11.3 Stima della media della popolazione . . . . . . . . . . . . . . . 55
11.4 Grappoli della stessa numerosità . . . . . . . . . . . . . . . . . 57
11.6 Grappoli di diversa numerosità e stimatore per quoziente . . . 58
12 Disegni campionari a probabilità variabile 60
12.1 Probabilità di inclusione . . . . . . . . . . . . . . . . . . . . . 60
12.2 Proprietà delle probabilità di inclusione . . . . . . . . . . . . . 62
12.3 Probabilità di inclusione per disegni campionari semplici . . . 63
14 Stimatori lineari della media della popolazione 65
14.2 Lo stimatore Horvitz-Thompson . . . . . . . . . . . . . . . . . 66
14.2.1 Costruzione dello stimatore di Horvitz-Thompson per
disegni campionari semplici: . . . . . . . . . . . . . . . 67
14.2.2 Stima della varianza dello stimatore di Horvitz-Thompson 68
14.2.6 Ruolo delle probabilit‘a di inclusione sull’efficienza del-
lo stimatore di Horvitz-Thompson nei disegni ad am-
piezza effettiva costante . . . . . . . . . . . . . . . . . 69
2
Appunti di Tecniche di
Campionamento
Giacomo Sancioni
1 Aspetti generali sul campionamento da po-
polazioni finite
1.2 Linee metodologiche essenziali di una rilevazione
statistica (censuaria o campionaria):
• una rilevazione riguarda un insieme finito di elementi individuali (unità
di osservazione, unità elementari), i quali costituiscono una popolazione
finita;
• sulle unità elementari sono definiti uno o più caratteri oggetto di interesse,
che si manifestano con una determinata modalità. Queste modalità so-
no riassunte mediante opportune sintesi descrittive, che costituiscono dei
parametri statistici di interesse;
• l’accesso agli elementi che costituiscono una popolazione è realizzato tra-
mite una lista, che può essere vista come un meccanismo che ad ogni
unità elementare della popolazione associa un’unità di campionamento
della lista;
• dalla lista viene selezionato un sottoinsieme di unità, denominato campio-
ne. La regola di selezione del campione è denominata disegno (o piano)
campionario;
• per gli elementi selezionati si osservano le modalità dei caratteri oggetto
di interesse tramite un qualche processo di misurazione (questionario);
• le modalità registrate costituiscono i dati campionari, che vengono usati
per calcolare delle stime dei parametri di interesse.
3
1.3 Popolazioni, etichette, modalità etichettate
{u }
Consideriamo una popolazione finita U = , ..., u composta da N unità
1 N
elementari. Ad ognuna di esse può essere assegnata un’etichetta che la identi-
fica univocamente: all’unità elementare u associamo l’etichetta i. L’insieme
i
{1, }
delle N etichette I = ..., N verrà considerato come popolazione di
N
riferimento.
Dato un carattere Y , indichiamo con y la modalità da esso assunta in corri-
i
spondenza dell’unità i. L’osservazione completa (o osservazione etichettata,
o modalità etichettata) dell’unità i è la coppia (i, y ): essa conserva l’infor-
i
mazione relativa non solo alla modalità osservata, ma anche all’unità a cui
si riferisce, e costituisce il dato statistico di base.
Per l’intera popolazione sono definite le N coppie (i, y ) equivalenti al vettore
i
T
Y = (y , ..., y ) . Questo vettore Y è il parametro della popolazione, in
N 1 N N
quanto individua univocamente il modo in cui il carattere si manifesta nella
popolazione (nei casi reali è infatti incognito).
Lo spazio dei parametri Ω è l’insieme di tutti i valori che Y può assu-
N N
N
⊂ →
mere (di solito Ω ogni modalità è un numero reale). Un parame-
R
N
tro statistico θ è una funzione delle modalità che costituiscono il vettore
Y : θ = θ(Y ) = θ(y , ..., y ).
N N 1 N
Esempio - media della popolazione: N
1 X y
µ = i
y N i=1
Esempio - varianza della popolazione:
N N
1 1
X X
2 2 2 2
− −
σ = (y µ ) = y µ
i y
y i y
N N
i=1 i=1
Esempio 1.1 (Popolazioni Dicotomiche). Si vuole studiare la presen-
za/assenza di un attributo A sulle unità della popolazione.
(
1 se l’unità i possiede l’attributo A
y =
i 0 altrimenti N
{0,
Lo spazio dei parametri Ω è l’insieme 1} . Indicato con N il numero
N A
di unità della popolazione che presentano l’attributo A e con P = N /N la
A A
proporzione di unità della popolazione che presentano l’attributo A:
N
N 1 X
A 2
2 2 2
− − −
= P ; σ = y P = P P = P (1 P )
µ = A A A A
y A
y i A
N N i=1 4
1.4 Popolazioni suddivise in sottopopolazioni
Una popolazione I può essere suddivisa in M sottoinsiemi distinti di unità,
N
ognuno dei quali costituisce una sua sottopopolazione. Le M sottopopola-
g
zioni I , g = 1, ..., M costituiscono una partizione della popolazione se:
N g g
1 2 M h
∪ ∪ ∪ ∩ ∅ ∀g ̸
I I ... I = I ; I I = = h
N
N N N N
N
1 2 g
M h
Ovviamente N + N + ... + N = N . Indicando con w = N /N il peso
1 2 M g g
della sottopopolazione g-esima, vale:
≤ ≤
0 w 1, w + ... + w = 1
g 1 M
Sia y la modalità dell’unità i della sottopopolazione g-esima e siano
gi N N
g g
1 1
X X
2 2
−
µ = y e σ = (y µ )
yg gi gi yg
yg
N N
g g
i=1 i=1
allora:
Proposizione 1.1:
• La media della popolazione è pari alla media ponderata delle medie delle
sottopopolazioni: M
X ·
µ = w µ
y g yg
g=1
Dimostrazione: N N
( ) M
M M
g g
1 N 1 X
X X X X
g ·
w µ
=
µ = y = y
y gi gi g yg
N N N
g g=1
g=1 g=1
i=1 i=1
• La varianza della popolazione è uguale alla somma della media della va-
rianza delle sottopopolazioni e della varianza delle medie delle sottopopo-
lazioni: M M
X X
2 2 2
· −
σ = w σ + w (µ µ )
g g yg y
y yg
g=1 g=1
5
Dimostrazione:
N
M g
1 X X
2 2
−
σ = (y µ )
gi y
y N g=1 i=1
N
M g
1 X X 2
{(y − −
= µ ) + (µ µ )}
gi yg yg y
N g=1 i=1
N N N
M g g g
1
X X X X
2 2
− − − −
(y µ ) + (µ µ ) + 2(µ µ ) (y µ )
= gi yg yg y yg y gi yg
N
g=1 i=1 i=1 i=1
N M
M g N
N 1
g
g X X
X 2 2
− −
+
(y µ )
= (µ µ )
gi yg yg y
N N N
g
g=1
g=1 i=1
M M
X X
2 2
· −
= w σ + w (µ µ )
g g yg y
yg
g=1 g=1
1.5 Liste di unità di campionamento
Una lista è un qualunque meccanismo che permette di accedere alle unità
della popolazione e di osservare le singole entità che compongono la lista.
Esse sono le unità di campionamento, in contrapposizione alle unità di
osservazione della popolazione. Tramite un’opportuna regola di selezione si
sceglie un campione di unità di campionamento, e tramite esse si accede alle
corrispondenti unità di osservazione della popolazione.
Nel caso più semplice è quello in cui nella lista sono elencate le unità di osser-
vazione della popolazione, le quali coincidono con le unità di campionamento.
In questo caso si parla di campionamento diretto di unità della popolazione.
Requisiti importanti per definire una buona lista:
• ogni unità della popolazione dovrebbe comparire una sola volta nella
lista;
• nella lista dovrebbero comparire solo le unità della popolazione.
La disponibilità di liste per il campionamento diretto di unità della popo-
lazione non è molto frequente nella pratica applicativa. Spesso le unità di
campionamento non coincidono con quelle di osservazione. Il caso ideale è
quello in cui la popolazione da lista coincide con quella obiettivo. In ge-
nerale rispetto alla popolazione obiettivo la lista deve possedere le seguenti
caratteristiche:
• completezza: deve avere tutte le unità della popolazione obiettivo;
6
• aggiornamento: non deve contenere unità estranee, duplicazioni e
ogni unità deve essere distinguibile dalla lista e individuabile.
Se ciò non accade, si è in presenza di imperfezioni di lista: sottocopertura,
sovracopertura, duplicazioni.
1.6 Rilevazioni statistiche e indagini statistiche
Per rilevazione statistica intenderemo l’attività che, rivolta alla produ-
zione di dati statistici, prevede piano di raccolta dei dati unitari, messa a
punto e controllo del piano di raccolta dati, raccolta dei dati, sistemazione e
prima elaborazione dei dati, ed infine la riduzione parametrica dei dati, ov-
vero la fase in cui vengono calcolate le stime dei parametri di interesse della
popolazione.
L’indagine statistica risulta invece più completa perché dopo una rileva-
zione statistica prevede anche fasi di analisi statistica di ipotesi in merito
all’indagine e modellizzazione descrittiva e operativa per il fenomeno oggetto
di indagine.
1.7 Fonti di errore e distorsioni
Nelle operazioni effettuate in ogni rilevazione statistica vi è la possibilità
di errori e distorsioni che possono grandemente influenzare i risultati che si
ottengono.
• Distorsioni ed errori nel campione: dipendono da imperfezioni
→
di lista e dal processo di selezione delle unità del campione sotto-
copertura (molto grave), duplicazioni, sovracopertura ed errori cam-
pionari (ineliminabile ma ridotto attraverso la scelta della numerosità
campionaria e della regola di selezione).
• Distorsione ed errori nel processo di acquisizione dei dati:
errori di misurazione, mancate risposte.
• Errori nell’elaborazione dei dati: codifica e trascrizione.
1.9 Campionamento Non Probabilistico
Si parla di campione probabilistico quando la selezione del campione av-
viene sulla base di una legge di probabilità nota a priori perché prefissata
dallo statistico in fase di progettazione della rilevazione. È necessario in que-
sto caso disporre della lista di unità che compongono la popolazione oggetto
7
di studio. Le unità della popolazione sono selezionate secondo un meccani-
smo casuale, e ogni unità ha probabilità nota e non nulla di essere inclusa
nel campione.
Nel campionamento non probabilistico la scelta delle unità campiona-
rie viene effettuata sulla base di criteri di comodo e di praticità e/o sulla
base di informazioni a priori relative alle caratteristiche della popolazione
di interesse. Questo campionamento infatti non consente di valutare la pre-
cisione delle stime e l’accuratezza dei risultati ottenuti. È utilizzato nelle
indagini in cui non è disponibile una lista di unità da cui estrarre il campione
o in quelle in cui si vuole contenere il costo di raccolta delle informazioni
(es. campionamento ragionato, campionamento per quote, campionamento
a valanga). 8
2 Campionamento probabilistico
2.1 Definizioni e proprietà di base
Un campione s è un qualunque insieme di unità della popolazione I . Lo
N
S
spazio dei campioni è l’insieme di tutti i campioni che si considerano.
S
Un disegno campionario (probabilistico) è una coppia (S, p(·)) in cui
S
è lo spazio dei campioni e p(·) è una distribuzione di probabilità su che
soddisfa le condizioni: X
≤ ∀s ∈ S
0 < p(s) 1 e p(s) = 1
s∈S
Un disegno campionario può essere classificato come:
• con ripetizione: se in almeno un campione s una stessa unità della
popolazione compare più di una volta;
• ordinato: se vi sono almeno due campioni s , s formati dalle stesse
1 2
unità, ma disposte in ordine differente (si usano le parentesi tonde per
gli insiemi ordinati e le parentesi graffe per quelli non ordinati);
• non informativo: se la probabilità p(s) con cui il campione viene
estratto non dipende dai valori della variabile di interesse Y associati
alle unità della popolazione.
La numerosità campionaria n(s) di un campione s è pari al numero di
unità che formano il campione. La numerosità campionaria effettiva ν(s)
è invece il numero di unità distinte che formano il campione. Vale sempre
≤
la relazione ν(s) n(s), con ν(s) = n(s) se e solo se nel campione s non vi
sono ripetizioni.
L’ampiezza media di un disegno campionario (
m̄) è il numero medio di
unità contenute nei campioni: X ·
n̄ = = n(s) p(s)
E[n(s)] s∈S
L’ampiezza media effettiva (ν̄) è il numero medio di unità distinte conte-
nute nei campioni: X ·
ν̄ = = ν(s) p(s)
E[ν(s)] s∈S
≤
Vale sempre ν̄ n̄, con uguaglianza se e solo se il disegno è senza ripetizione.
9
La riduzione z(s) di un campione s è l’insieme delle sue unità distinte, per
cui m(z(s)) = ν(s). Se facciamo corrispondere ad ogni campione originale la
∗ ∗
sua riduzione, otteniamo un nuovo disegno campionario (S , p (·)) chiamato
riduzione del disegno originale, dove:
• ∗
S S:
lo spazio dei campioni è l’insieme di tutte le riduzioni di
∗ ∗
S {s ∈ S}
= = z(s) : s
• ∗
ogni campione ridotto s ha una probabilità pari alla somma delle pro-
∗
babilità dei campioni originali che si riducono a esso. Posto C(s ) =
∗
{s ∈ S },
: z(s) = s si ha: X
∗ ∗
p (s ) = p(s)
∗
s∈C(s ) ∀s ∈ S,
Un disegno campionario si dice ad ampiezza costante se n(s) = n ad
∀s ∈ S.
ampiezza effettiva costante se ν(s) = ν
2.3 Dati campionari etichettati
Il campione di modalità etichettate y(s) è costituito dalle coppie unità-
modalità: {(i, ∈
y(s) = y ) : i s}
i {(i, ∈
Il corrispondente campione ridotto è y(z(s)) = y ) : i z(s)}. Poiché
i
l’ordine di estrazione e le ripetizioni sono irrilevanti ai fini del contenuto
informativo, lo spazio campionario originale y(s) e la sua riduzione y(z(s))
hanno lo stesso id
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
-
Metodi Qualitativi - Appunti Completi
-
Linguaggi di Programmazione - Appunti in LaTeX
-
Statistica - Appunti
-
Appunti Fitochimica