Estratto del documento

STATISTICA BASE

Quando in laboratorio misuriamo una grandezza (concentrazione, resa, assorbanza...), otteniamo solo un campione di dati, ovvero una parte di una popolazione che e` stata selezionata tramite un esperimento. La selezione e` del tutto casuale. L'inferenza statistica e` il procedimento per cui si inducono le caratteristiche di una popolazione a partire dall'osservazione del campione.

L'inferenza statistica si basa su tre elementi:

  1. Stime puntuali -> un numero che riassume i dati (es. la media).
  2. Stime per intervallo -> un intervallo entro cui con una certa probabilita` si trova il valore vero.
  3. Test d'ipotesi -> strumenti per confrontare medie, varianze o per capire se un dato e` anomalo.

Se un fenomeno e` normale:

xi ~ N(μ, σ2)

La media di n misure:

x̄ ~ N(μ, σ2/n)

-> La media ha deviazione standard σ/√n -> piu` dati = maggiore precisione.

Anche se la popolazione NON e` normale, la media di un campione grande tende ad essere normale. Per questo in laboratorio si usa quasi sempre la normale per stimare l'incertezza di una media. La media e` il valore piu` stabile delle singole misure e tende sempre piu` al valore vero man mano che aumentano i dati.

Stime puntuali

Cos'e` una stima puntuale?La stima puntuale consiste nell'uso di un unico numero, calcolato dai dati del campione, per stimare un parametro della popolazione (es. media vera μ, varianza vera σ2). Per stimarli usiamo delle formule, chiamate stimatori.

Cos'e` uno stimatore?Uno stimatore (T) e` una formula che prende i dati del campione e restituisce un numero che vuole rappresentare il parametro. T e` ottenuto "mettendo dentro" la formula tutti i dati.Uno stimatore e` "buono" se da` risultati ragionevoli anche quando i dati sono pochi o hanno variazione naturale

STATISTICA BASE

Quando in laboratorio misuriamo una grandezza (concentrazione, resa, assorbanza...), otteniamo solo un campione di dati, ovvero una parte di una popolazione che e stata selezionata tramite un esperimento. La selezione e del tutto casuale. L'inferenza statistica e il procedimento per cui si inducono le caratteristiche di una popolazione a partire dall'osservazione del campione.

L'inferenza statistica si basa su tre elementi:

  1. Stime puntuali - un numero che riassume i dati (es. la media).
  2. Stime per intervallo - un intervallo entro cui con una certa probabilita si trova il valore vero.
  3. Test d'ipotesi - strumenti per confrontare medie, varianze o per capire se un dato e anomalo.

Se un fenomeno e normale:

xi ~ N(mu, sigma2)

La media di n misure:

xbar ~ N(mu, sigma2/n)

- La media ha deviazione standard sigma/sqrt(n) - piu dati = maggiore precisione.

Anche se la popolazione NON e normale, la media di un campione grande tende ad essere normale. Per questo in laboratorio si usa quasi sempre la normale per stimare l'incertezza di una media. La media e il valore piu stabile delle singole misure e tende sempre piu al valore vero man mano che aumentano i dati.

Stime puntuali

Cos'e una stima puntuale?

La stima puntuale consiste nell'uso di un unico numero, calcolato dai dati del campione, per stimare un parametro della popolazione (es. media vera mu, varianza vera sigma2). Per stimarli usiamo delle formule, chiamate stimatori.

Cos'e uno stimatore?

Uno stimatore (T) e una formula che prende i dati del campione e restituisce un numero che vuole rappresentare il parametro. T e ottenuto "mettendo dentro" la formula tutti i dati. Uno stimatore e "buono" se da risultati ragionevoli anche quando i dati sono pochi o hanno variazione naturale

Stimatori comuni

  • Media campionaria (x) -> stima u (media di un campione di n dati)

Uno degli estimatori pi o importanti e la media campionaria. E semplicemente il valore medio delle misure.

x = 1/n Σni=1xi

La media e lo stimatore naturale della media vera u perche:

  • usa tutti i dati
  • e facile da calcolare
  • se aumentiamo il numero di misure, x si avvicina sempre di pi u a u
  • Deviazione standard campionaria (s) -> stima o (varianza di un campione di n dati)

Per misurare quanto i dati sono dispersi, usiamo la deviazione standard campionaria, indicata con "s":

s = √(1/(n-1) Σni=1(xi - x)2)

Essa stima la deviazione standard vera o, cioe quanta "variabilita naturale" c'e nelle misure.

  • s grande -> dati molto sparsi
  • s piccolo -> dati molto concentrati attorno alla media

Il bias e l'errore sistematico di uno stimatore. Significa che, anche se ripetessi l'esperimento un numero infinito di volte, lo stimatore non arriverebbe al valore vero. In altre parole:

  • uno stimatore biased = sbaglia in media
  • uno stimatore unbiased = in media da il valore corretto

Il bias e la differenza tra il valore medio dello stimatore e il valore vero del parametro.

Esempio: Supponiamo che la vera media della popolazione sia u=10. Prendiamo tanti campioni diversi e calcoliamo uno stimatore della media:

  • Se lo stimatore restituisse mediamente 10 -> unbiased
  • Se restituisse mediamente 9.5 -> biased (sottostima)
  • Se restituisse mediamente 10.3 -> biased (sovrastima)

Applicato alle formule della varianza di un campione di n dati

Se usassimo questa formula:

s2 = 1/n Σ (xi - x)2

La varianza sarebbe biased -> troppo piccola.Perche? Perche x e calcolata sullo stesso campione e tende a "tirare" i dati verso di sé.Risultato: la dispersione viene vista come pi u piccola di quanto sia nella realtà.La soluzione: usare n-1

La formula corretta è:

s2 = 1/(n - 1) Σ (xi - x̄)2

La varianza stimata con n-1, se l’esperimento fosse ripetuto infinite volte, in media coincide con la varianza vera.

Distribuzione t

In laboratorio, quasi mai si conosce σ (deviazione standard della popolazione). Si usa quindi la deviazione campionaria s, ma con pochi dati questa stima è incerta. Student (Gosset) scoprì che in casi di campioni con n< 30 la statistica:

t = (x̄ - μ) / (s/√n)

(x - μ)/s ~ tv

Quando stimiamo σ usando s (deviazione campionaria), stiamo introducendo ulteriore incertezza.

→ La distribuzione t tiene conto del fatto che s non è perfettamente affidabile con pochi dati.

Questo fa sì che:

  • le code della t siano più grandi
  • i valori critici siano più lontani da 0
  • gli intervalli di confidenza siano più ampi

È un modo per “proteggere” l’analisi dal rischio di trarre conclusioni troppo ottimistiche. Quando n aumenta, la distribuzione t si avvicina alla distribuzione z.

Distribuzione z

La distribuzione z è la distribuzione normale standardizzata, cioè:

  • media = 0
  • deviazione standard = 1

Si indica così:

z ~ N(0,1)

La distribuzione z si usa quando la deviazione standard della popolazione s e' nota (questo succede quasi mai in laboratorio),Il campione e' grande e la distribuzione e' normale (o quasi).

In questi casi la statistica:

z = (xbar - mu) / (sigma / sqrt(n))

(x - mu) / sigma ~ z

segue una normale standardizzata.

Curva rossa: La distribuzione normale Standardizzata z

(x - mu) / sigma ~ z

Con Excel: z1-0,5/2 = INV.NORM.N(0,975;0;1)

Dati fuori controllo di qualita': 36.7%

Curva blu: la distribuzione t di Student con v gradi di liberta'

(x - mu) / s ~ tv

Con Excel: t1-0.5/2,v = INVT(0,975; v)

ta/2,v za/2 z1-a/2 t1-a/2,v

IC(95%)

za/2 < z < z1-a/2

IC(95%)

La campana di z e' stretta e precisa mentre quella t e' piu' bassa e piu' larga ai lati. Con pochi dati (piccoli n), la campana t e' molto piu' larga. Con tanti dati, quasi non si distinguono.

F-test → confronto tra varianze

Serve per capire se due studenti/laboratori/metodi hanno la stessa precisione.

Regola sul p-value:

  • p > 0.05 → varianze compatibili0.001 < p < 0.05 → varianze diverse
  • p < 0.001 → precisioni molto diverse

T-test tra medie

Usato per confrontare due metodi, due catalizzatori, ecc.

Regola:

Anteprima
Vedrai una selezione di 1 pagina su 5
Lezioni di laboratorio teoria Pag. 1
1 su 5
D/illustrazione/soddisfatti o rimborsati
Acquista con carta o PayPal
Scarica i documenti tutte le volte che vuoi
Dettagli
SSD
Scienze economiche e statistiche SECS-S/01 Statistica

I contenuti di questa pagina costituiscono rielaborazioni personali del Publisher nicariri di informazioni apprese con la frequenza delle lezioni di Laboratorio 1 e studio autonomo di eventuali libri di riferimento in preparazione dell'esame finale o della tesi. Non devono intendersi come materiale ufficiale dell'università Università degli Studi di Padova o del prof Biffis Andrea.
Appunti correlati Invia appunti e guadagna

Domande e risposte

Hai bisogno di aiuto?
Chiedi alla community