Estratto del documento

Appunti data science for marketing

Regressione multipla

Y = variabile dipendente

X1, X2, X3, …, Xn = variabili esplicative

L'output della regressione multipla in SPSS

Analizza la relazione tra una variabile dipendente e più variabili indipendenti. Le sezioni principali includono:

  • Modello di regressione: Fornisce la formula matematica del modello, dove l'intercetta (b0) e i coefficienti di regressione (bi) indicano la relazione tra le variabili.
  • ANOVA: Valuta la significatività statistica complessiva del modello. L'output principale è il valore di F, che indica se la varianza spiegata dal modello è maggiore di quella casuale.
  • R-quadro: Misura la proporzione della varianza della variabile dipendente spiegata dal modello.
  • Coefficienti: Mostra i coefficienti di regressione standardizzati () e non standardizzati (b), insieme alle loro statistiche di significatività (p-value), per valutare l'impatto di ciascuna variabile indipendente.
  • Verifica della multicollinearità (VIF): Indica se le variabili indipendenti sono correlate tra loro, il che può influenzare l'affidabilità del modello.

Tabella modello di regressione

  • Coefficiente R: Radice quadrata di R-quadro, rappresenta la correlazione multipla tra la variabile dipendente e le variabili indipendenti.
  • R-quadro: Indica la percentuale di varianza della variabile dipendente spiegata dal modello. Ad esempio, un R-quadro di 0.60 significa che il modello spiega il 60% della variabilità della variabile dipendente.
  • R-quadro corretto: Una versione aggiustata di R-quadro, utile per confrontare modelli con un numero diverso di variabili indipendenti.
  • Errore standard della stima: Misura la deviazione standard dei residui, ovvero la differenza tra i valori osservati e quelli previsti.

Tabella ANOVA

Serve per verificare le ipotesi nulle.

  • F-value: Un valore elevato indica che il modello è complessivamente statisticamente significativo.
  • Sig.: Il p-value associato al valore F. Se minore di 0.05, il modello complessivo è significativo.

Tabella coefficienti

  • Coeff.: I coefficienti non standardizzati.
  • Costante (Intercetta): Il valore stimato della variabile dipendente quando tutte le variabili indipendenti sono zero.
  • Indipendenti: Il coefficiente indica la variazione nella variabile dipendente per ogni unità di aumento della variabile indipendente, tenendo costanti le altre variabili.
  • Std. Error: L'errore standard del coefficiente. Più l’errore standard è piccolo, più la stima calcolata si avvicina alla realtà.
  • Beta (o Coeff. Standardizzati): I coefficienti di regressione standardizzati, utili per confrontare l'impatto relativo delle diverse variabili indipendenti.
  • t: La statistica t associata a ciascun coefficiente.
  • Sig.: Il p-value associato al test t per ciascun coefficiente. Se minore di 0.05, il coefficiente è statisticamente significativo.

Verifica della multicollinearità

VIF (Variance Inflation Factor): Valori superiori a 5 o 10 possono indicare problemi di multicollinearità, cioè un'eccessiva correlazione tra le variabili indipendenti.

Residui

L'analisi dei residui (differenze tra valori osservati e predetti) è fondamentale per verificare le assunzioni del modello di regressione. I grafici dei residui possono aiutare a identificare pattern che violano le assunzioni del modello.

Tabella ANOVA (Analysis of Variance) in SPSS

  • Fonte di variazione: Spesso indica le fonti della variabilità come "Regressione" (tra i gruppi) e "Residuo" (all'interno dei gruppi).
  • Somma dei quadrati (SS): La somma dei quadrati della varianza spiegata dal modello (Regressione) e della varianza non spiegata (Residuo).
  • Gradi di libertà (df): Il numero di valori indipendenti che variano in una statistica. Ad esempio, i gradi di libertà per la regressione sono il numero di predittori, mentre quelli per il residuo sono dati dalla dimensione totale del campione meno i gradi di libertà della regressione.
  • Quadrato medio (MS): Ottenuto dividendo la Somma dei Quadrati per i Gradi di Libertà (MS = SS/df).
  • Valore F: Il rapporto tra il Quadrato Medio del modello e il Quadrato Medio del residuo (=/).
  • Significatività (p-value): La probabilità di ottenere un valore F così estremo o più estremo, assumendo che non ci sia differenza tra i gruppi. Un valore p-value inferiore a 0.05 indica che le differenze tra le medie dei gruppi sono statisticamente significative.

L'output della regressione multipla in Excel

Va interpretato analizzando la sezione "Statistiche di riepilogo" e la tabella dei "Coefficienti". Nella prima, l'R-quadro indica la percentuale di variabilità della variabile dipendente spiegata dal modello, mentre la "Regressione" e i "Residui" indicano la differenza tra i valori effettivi e quelli previsti dal modello. Nella tabella dei coefficienti, si trovano i valori di Intercetta (beta0) e i coefficienti di regressione delle variabili indipendenti (beta1, beta2, ...) che quantificano l'impatto di ciascuna variabile indipendente sulla variabile dipendente.

Sezione statistiche di riepilogo

  • Regression Statistics: L'output include metriche come il coefficiente di determinazione (R-quadro) e la sua versione corretta, che quantificano quanto bene il modello si adatta ai dati.
  • R-quadro: È un valore compreso tra 0 e 1. Più si avvicina a 1, maggiore è la variabilità della variabile dipendente spiegata dal modello. Un valore vicino a 1 suggerisce che il modello è un buon adattamento ai dati.
  • Significatività statistica (p-value): Si analizza anche la significatività dei risultati, per capire se le relazioni trovate sono statisticamente valide e non dovute al caso.
  • Regression, residui e Intercetta: Questi valori sono essenziali per valutare le prestazioni complessive del modello di regression
Anteprima
Vedrai una selezione di 3 pagine su 10
Appunti Data Science for Marketing Pag. 1 Appunti Data Science for Marketing Pag. 2
Anteprima di 3 pagg. su 10.
Scarica il documento per vederlo tutto.
Appunti Data Science for Marketing Pag. 6
1 su 10
D/illustrazione/soddisfatti o rimborsati
Acquista con carta o PayPal
Scarica i documenti tutte le volte che vuoi
Dettagli
SSD
Scienze economiche e statistiche SECS-P/08 Economia e gestione delle imprese

I contenuti di questa pagina costituiscono rielaborazioni personali del Publisher margheritacarrara di informazioni apprese con la frequenza delle lezioni di Data Science for Marketing e studio autonomo di eventuali libri di riferimento in preparazione dell'esame finale o della tesi. Non devono intendersi come materiale ufficiale dell'università Università degli Studi di Parma o del prof Cerioli Andrea.
Appunti correlati Invia appunti e guadagna

Domande e risposte

Hai bisogno di aiuto?
Chiedi alla community