Formulario di machine learning
Linear regression
- Dati: , , , …. ̂ = [ , , … ]
- Calcolare la predizione di un dato punto:
0 1 2 1 2()̂ = ℎ = + + + ⋯ 0 1 1 2 2
- Errore di predizione: = ̂ − = ℎ −
- Funzione di costo Mean square error:
1 2( ) )() = ∑(ℎ − 2 =1
- Gradient descent per regressione lineare: trovare i valori ottimali dei parametri devo fare la derivata→ prendendo come variabile ogni funzione uguale per ogni moltiplichiamo per ogni x associata
- [−1, 1] Coefficiente di Pearson: per capire la relazione tra due variabili
Regressore polinomiale
- Funzione di costo:
1 2 () = ∑(ℎ ( ) − )2 =1
Logistic regression
[0; 1]: ipotesi che varia nel range utilizzo la sigmoid function sulla linear regression:
1()̂ = ℎ = ( ) − 1 + = () ≥ 0.5
Se è positiva è
- Funzione di costo: (Cost (h ( x) , y) − ln( h x))= Se y = 1 : θ θ (Cost (h ( x) , y) = − ln( 1 − h x)) Se y= 0 : θ θ
Tecniche di normalizzazione
- Min/max normalization: utilizzando min e max del training set − = −
- Mean normalization: utilizzando media e deviazione standard del training set
Regolarizzazione
- Regolarizzazione per regressione: Funzione di costo di linear regression + ridge regression:
1 2 2 () = − + ∑ [∑(ℎ ( ) ) ]2 =1 =1 o m : numero di esempio n: numero di feature
- Regolarizzazione per classificazione: Funzione di costo della logistic regression + regolarizzazione (Cost (h ( x) , y) − ln( h x))= Se y = 1 : θ θ (Cost (h ( x) , y) = − ln( 1 − h x)) Se y= 0 : θ θ
- Migliorare underfit:
- Usare più features
- Diminuire il termine di regolarizzazione
- Usare modelli più complessi
- Migliorare overfit:
- Aggiungere esempi di training
- Usare meno feature
- Incrementare il termine di regolarizzazione
Analisi testuale
TF-IDF: rappresenta un