Stat. descrittiva
X = matrice dei dati
X = [xij]
Elementi della matrice (non per forza numeri)
v2 = risultato blu
v1 = risultato rosso
x -> minuscola
X -> maiuscola
Campione = insieme unità statistiche
Righe -> omogenee
Colonne -> non sempre omogenee
Stat. univariata
1 sola colonna, omogeneità delle features
X = (x1, x2, x3, .., xn) (Xi) i = 1,.. n
Tipi di dati
- Qualitativi (categorici)
- Nominali: (es. maschio/femmina) -> Xi è una categoria
- Xi ∈ {c1, c2, ...}
- Ordinali: (es. taglie vestiti categorie che hanno un ordine)
- Xi ∈ {c1, c2, ... ck}
- Con c1 ≤ c2 ≤ ... ≤ ck
- Xi ∈ una categoria "ordinata"
- Quantitativi (numerici)
- Discreti: Xi ∈ insieme finito/infinito numerabile e CR (es. età anagrafica) voto in 30esimi
- Continui: Xi ∈ insieme infinito e non numerabile e CR (cardinalità infinita) tonalità infinita
- (es. temperatura stelle nella galassia)
Stat. descrittiva
X = matrice dei dati
X = [ xij ]
Elementi della matrice
vz = risultato blu
v1 = risultato rosso
NB
x → minuscola
X → maiuscola
Campione = insieme unità statistiche
Stat. univariata
1 sola colonna, omogeneità delle features
X = (x1, x2, x3, ..., xn) (Xi) i = 1, ..., n
Tipi di dati
- Qualitativi (categorici)
- Nominali: (es. maschio/femmina) → Xi è una categoria
- Xi ∈ {c1, c2, ...}
- Ordinali: (es. taglie vestiti) categorie che hanno un ordine, → Xi ∈ {c1, c2, ..., ck}
- Con c1 ≤ c2 ≤ ... ≤ ck
- Quantitativi (numerici)
- Discreti: Xi ∈ insieme finito/infinito numerabile e CR (es. età anagrafica) (voto in 30esimi)
- Continui: Xi ∈ insieme infinito e non numerabile e CR (cardinalità infinita) (temperatura stelle nella galassia)
Indici statistici
Dati numerici
Indici di posizione
- Media campionaria: n1 ∑ i=1n xi (baricentro, migliore approssimazione deterministica dei dati)
Indici di dispersione
- Varianza campionaria: S2 = n-11 ∑ i=1n (xi - ∑)2 (quadrato perché >= sempre > 0)
- Deviazione standard campionaria: s = √ S2
Indici robusti
→ Indici robusti (robusti rispetto alla presenza di outlier nel dataset)
- Medie trimmed
- Mediana campionaria = med(X)
Dato un dataset di n punti, → se n = dispari, c'è un numero che divide in due parti di ugual peso il dataset
Q1(X) = QX) = intervallo interquartile
Quartili campionari
- Q1 (25%/75%)
- Q2 (50%/50%)
- Q3 (75%/25%)
Dividono la nuvola di punti in 4 parti (25%) di ugual peso
n = 30.25 = 1.75
Questi quartili possono essere punti/intervalli
Tendenzialmente punto centrale
Dataset
Indici statistici
Dati categorici
x1, x2, x3, ... xn ∈ {C1, C2, ... Cs}
i = 1, ..., n g = 1, ..., G
Numero dati
Numero possibili categorie
Frequenze assolute campionarie
ng = n⁄i=1Σ 1xi = Cg
Funzione indicatrice → valore SE la condizione in input è vera, valore 0 se è falsa
NB
La somma delle Freq. ass. è n
G⁄g=1Σ ng = n
Frequenze relative campionarie
Fg = ng⁄n
→ proporzione di volte che ho osservato classe g-esima
NB
G⁄g=1Σ Fg = 1
Moda campionaria = valore che massimizza le frequenze assolute relative
fmoda = max Fg g= 1, ..., G
(se la maggior parte sono bocciati → fmoda = bocciato)
Entropia campionaria
Entropia campionaria (Dispersione)
entropy = G⁄g=1Σ g2
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.
Scarica il documento per vederlo tutto.