STATISTICA BASE
Quando in laboratorio misuriamo una grandezza (concentrazione, resa, assorbanza...), otteniamo solo un campione di dati, ovvero una parte di una popolazione che e` stata selezionata tramite un esperimento. La selezione e` del tutto casuale. L'inferenza statistica e` il procedimento per cui si inducono le caratteristiche di una popolazione a partire dall'osservazione del campione.
L'inferenza statistica si basa su tre elementi:
- Stime puntuali -> un numero che riassume i dati (es. la media).
- Stime per intervallo -> un intervallo entro cui con una certa probabilita` si trova il valore vero.
- Test d'ipotesi -> strumenti per confrontare medie, varianze o per capire se un dato e` anomalo.
Se un fenomeno e` normale:
xi ~ N(μ, σ2)
La media di n misure:
x̄ ~ N(μ, σ2/n)
-> La media ha deviazione standard σ/√n -> piu` dati = maggiore precisione.
Anche se la popolazione NON e` normale, la media di un campione grande tende ad essere normale. Per questo in laboratorio si usa quasi sempre la normale per stimare l'incertezza di una media. La media e` il valore piu` stabile delle singole misure e tende sempre piu` al valore vero man mano che aumentano i dati.
Stime puntuali
Cos'e` una stima puntuale?La stima puntuale consiste nell'uso di un unico numero, calcolato dai dati del campione, per stimare un parametro della popolazione (es. media vera μ, varianza vera σ2). Per stimarli usiamo delle formule, chiamate stimatori.
Cos'e` uno stimatore?Uno stimatore (T) e` una formula che prende i dati del campione e restituisce un numero che vuole rappresentare il parametro. T e` ottenuto "mettendo dentro" la formula tutti i dati.Uno stimatore e` "buono" se da` risultati ragionevoli anche quando i dati sono pochi o hanno variazione naturale
STATISTICA BASE
Quando in laboratorio misuriamo una grandezza (concentrazione, resa, assorbanza...), otteniamo solo un campione di dati, ovvero una parte di una popolazione che e stata selezionata tramite un esperimento. La selezione e del tutto casuale. L'inferenza statistica e il procedimento per cui si inducono le caratteristiche di una popolazione a partire dall'osservazione del campione.
L'inferenza statistica si basa su tre elementi:
- Stime puntuali - un numero che riassume i dati (es. la media).
- Stime per intervallo - un intervallo entro cui con una certa probabilita si trova il valore vero.
- Test d'ipotesi - strumenti per confrontare medie, varianze o per capire se un dato e anomalo.
Se un fenomeno e normale:
xi ~ N(mu, sigma2)
La media di n misure:
xbar ~ N(mu, sigma2/n)
- La media ha deviazione standard sigma/sqrt(n) - piu dati = maggiore precisione.
Anche se la popolazione NON e normale, la media di un campione grande tende ad essere normale. Per questo in laboratorio si usa quasi sempre la normale per stimare l'incertezza di una media. La media e il valore piu stabile delle singole misure e tende sempre piu al valore vero man mano che aumentano i dati.
Stime puntuali
Cos'e una stima puntuale?
La stima puntuale consiste nell'uso di un unico numero, calcolato dai dati del campione, per stimare un parametro della popolazione (es. media vera mu, varianza vera sigma2). Per stimarli usiamo delle formule, chiamate stimatori.
Cos'e uno stimatore?
Uno stimatore (T) e una formula che prende i dati del campione e restituisce un numero che vuole rappresentare il parametro. T e ottenuto "mettendo dentro" la formula tutti i dati. Uno stimatore e "buono" se da risultati ragionevoli anche quando i dati sono pochi o hanno variazione naturale
Stimatori comuni
- Media campionaria (x) -> stima u (media di un campione di n dati)
Uno degli estimatori pi o importanti e la media campionaria. E semplicemente il valore medio delle misure.
x = 1/n Σni=1xi
La media e lo stimatore naturale della media vera u perche:
- usa tutti i dati
- e facile da calcolare
- se aumentiamo il numero di misure, x si avvicina sempre di pi u a u
- Deviazione standard campionaria (s) -> stima o (varianza di un campione di n dati)
Per misurare quanto i dati sono dispersi, usiamo la deviazione standard campionaria, indicata con "s":
s = √(1/(n-1) Σni=1(xi - x)2)
Essa stima la deviazione standard vera o, cioe quanta "variabilita naturale" c'e nelle misure.
- s grande -> dati molto sparsi
- s piccolo -> dati molto concentrati attorno alla media
Il bias e l'errore sistematico di uno stimatore. Significa che, anche se ripetessi l'esperimento un numero infinito di volte, lo stimatore non arriverebbe al valore vero. In altre parole:
- uno stimatore biased = sbaglia in media
- uno stimatore unbiased = in media da il valore corretto
Il bias e la differenza tra il valore medio dello stimatore e il valore vero del parametro.
Esempio: Supponiamo che la vera media della popolazione sia u=10. Prendiamo tanti campioni diversi e calcoliamo uno stimatore della media:
- Se lo stimatore restituisse mediamente 10 -> unbiased
- Se restituisse mediamente 9.5 -> biased (sottostima)
- Se restituisse mediamente 10.3 -> biased (sovrastima)
Applicato alle formule della varianza di un campione di n dati
Se usassimo questa formula:
s2 = 1/n Σ (xi - x)2
La varianza sarebbe biased -> troppo piccola.Perche? Perche x e calcolata sullo stesso campione e tende a "tirare" i dati verso di sé.Risultato: la dispersione viene vista come pi u piccola di quanto sia nella realtà.La soluzione: usare n-1
La formula corretta è:
s2 = 1/(n - 1) Σ (xi - x̄)2
La varianza stimata con n-1, se l’esperimento fosse ripetuto infinite volte, in media coincide con la varianza vera.
Distribuzione t
In laboratorio, quasi mai si conosce σ (deviazione standard della popolazione). Si usa quindi la deviazione campionaria s, ma con pochi dati questa stima è incerta. Student (Gosset) scoprì che in casi di campioni con n< 30 la statistica:
t = (x̄ - μ) / (s/√n)
(x - μ)/s ~ tv
Quando stimiamo σ usando s (deviazione campionaria), stiamo introducendo ulteriore incertezza.
→ La distribuzione t tiene conto del fatto che s non è perfettamente affidabile con pochi dati.
Questo fa sì che:
- le code della t siano più grandi
- i valori critici siano più lontani da 0
- gli intervalli di confidenza siano più ampi
È un modo per “proteggere” l’analisi dal rischio di trarre conclusioni troppo ottimistiche. Quando n aumenta, la distribuzione t si avvicina alla distribuzione z.
Distribuzione z
La distribuzione z è la distribuzione normale standardizzata, cioè:
- media = 0
- deviazione standard = 1
Si indica così:
z ~ N(0,1)
La distribuzione z si usa quando la deviazione standard della popolazione s e' nota (questo succede quasi mai in laboratorio),Il campione e' grande e la distribuzione e' normale (o quasi).
In questi casi la statistica:
z = (xbar - mu) / (sigma / sqrt(n))
(x - mu) / sigma ~ z
segue una normale standardizzata.
Curva rossa: La distribuzione normale Standardizzata z
(x - mu) / sigma ~ z
Con Excel: z1-0,5/2 = INV.NORM.N(0,975;0;1)
Dati fuori controllo di qualita': 36.7%
Curva blu: la distribuzione t di Student con v gradi di liberta'
(x - mu) / s ~ tv
Con Excel: t1-0.5/2,v = INVT(0,975; v)
ta/2,v za/2 z1-a/2 t1-a/2,v
IC(95%)
za/2 < z < z1-a/2
IC(95%)
La campana di z e' stretta e precisa mentre quella t e' piu' bassa e piu' larga ai lati. Con pochi dati (piccoli n), la campana t e' molto piu' larga. Con tanti dati, quasi non si distinguono.
F-test → confronto tra varianze
Serve per capire se due studenti/laboratori/metodi hanno la stessa precisione.
Regola sul p-value:
- p > 0.05 → varianze compatibili0.001 < p < 0.05 → varianze diverse
- p < 0.001 → precisioni molto diverse
T-test tra medie
Usato per confrontare due metodi, due catalizzatori, ecc.
Regola: