Estratto del documento

METODI STATISTICI PER IL MANAGEMENT

Lezione 1 (03/11/2025)

Introduzione al corso

Materiale: lucidi (nella cartella del materiale condiviso su teams), slides e esercitazioni, SAS

(software da utilizzare online)

Esame: test a risposta chiusa e aperta.

Quali sono i prerequisiti di questo corso? È un corso avanzato. I prerequisiti sono aver fatto

statistica. Cos'è la media? Cos'è la varianza? Cos'è la correlazione? Cos'è un test statistico?

Cos'è un intervallo di confidenza? Cos'è una sigla puntuale? Concetti che via via tireremo

fuori. [vd slides richiami di statistica]

Cosa vedremo in questo corso?

Tra i metodi e i modelli che vedremo ci sono metodi e strumenti multivariati (cioè che vado

ad analizzare il rapporto tra due o più variabili, due o più caratteristiche). In statistica si è

studiato il legame tra due caratteri in tabella doppia. E infatti si chiama analisi bivariata.

Ora vediamo tre o più variabili. Quindi prima caratteristica è lavorare con più variabili.

Secondo aspetto è come ci vogliamo lavorare, due obiettivi di ricerca, cioè in che modo

questa avviene:

a) Analisi della dipendenza, voglio vedere come una variabile dipende da altre. Per

esempio voglio capire la spesa per consumo per beni alimentari che può dipendere

dal reddito, dalle abitudini, dalle componenti della famiglia, dal luogo in cui abito,

l’età…le variabili che influiscono sulla spesa sono infinite. Ecco allora la domanda di

ricerca, cos'è? Da cosa dipende la spesa per beni alimentari di una famiglia? Quali

sono i fattori che ne determinano un consumo, una spesa alta media bassa? Questa

è una domanda che si riferisce a un problema di analisi della dipendenza. Il ruolo tra

le variabili è diverso. Se noi indichiamo con la Y la variabile dipendente del nostro

consumo per beni alimentari e con X la varabile indipendente. Il ruolo tra X e Y è

diverso, perché una dipende dall’altra. Questa si chiama appunto analisi della

dipendenza.

Abbiamo due tipi di modelli classici della statistica, che vanno ad analizzare la

dipendenza di una variabile Y rispetto a delle variabili X. Un primo problema è quando

la X è quantitativa. Cosa vuol dire quantitativa? Quantitativa vuol dire che abbiamo

dei numeri. Il problema di dipendenza si chiamerà regressione. Quindi, quando la Y

è quantitativa rispetto a una o più variabili esplicative X, c’è un problema di

regressione. Perché? Il primo studio che ha affrontato questo tema della dipendenza

è stato uno studio di 200 anni fa che voleva dimostrare che la statura dei figli

dipendeva dalla statura dei genitori, quindi regredisce quel valore numerico che è la

statura del figlio, lo facciamo regredire alla statura del genitore.

Però abbiamo degli studi di dipendenza in cui la X è qualitativa. Ad esempio,

pensiamo di avere lavori più manuali, lavori più intellettuali. Oppure il titolo di studio,

dipende dall’età. Anche qui ci sono variabili esplicative. Quando la variabile Y è

qualitativa, il modello è un modello di classificazione. Perché? Conoscendo le X

posso sapere il titolo di studio, cioè la categoria, a seconda delle X.

1

Noi vedremo dei modelli sia dell’uno che dell’altro. In particolare:

- Dipendenza quantitativa, modello della regressione:

Regressione lineare

ANOVA (analisi della varianza)

AR(1) i valori delle Y non sono indipendenti ma correlati tra loro.

- Dipendenza qualitativa, modello della classificazione:

Modello logit/probit (in cui la Y può assumere due valori 1 o 0).

b) Analisi dell’interdipendenza. In questo caso ho un insieme di X, che hanno lo

stesso ruolo. Ci interessa capire se tra queste variabili c’è un legame,

un’interdipendenza. Pensiamo se misuriamo la statura, la lunghezza del braccio,

della gamba e del piede. Sono tante variabili numeriche. Queste variabili sono tra

loro legate o no? Assolutamente legate. se X è piccolo anche gli altri sono piccoli e

1

viceversa. Il mio obiettivo è capire se queste variabili sono legate tra loro. Per capirlo

si usa l’analisi in componenti principali (ACP). È una tecnica che va a capire se le

variabili sono legate tra di loro.

Capire se sono legate serve a capire tante cose. Ad esempio, conoscere queste

variabili mi permette di ridurle in un solo indice. Tipo indice qualità della vita è la

sintesi di tante variabili. Quanto più queste variabili sono legate tra loro, tanto più si

possono sintetizzare facilmente in un unico indicatore. Quando si cerca di sintetizzare

le variabili in uno o due indicatori, si può utilizzare questa analisi.

L’ACP si può usare solo se sono variabili quantitative, cioè numeriche. Però ci sono

tecniche analoghe in cui le X sono miste. Noi faremo solo ACP.

Altro problema dell’interdipendenza è che ad esempio in un gruppo di persone ci

possono essere anche dei gruppi di amicizie. Se conoscessi il legame potrei

decostruire questo gruppo di persone in tanti sottogruppi. I sottogruppi hanno delle

unità interne molto affini e molto diverse dagli altri gruppi. Quindi, se ho un insieme

di clienti e osservo gli acquisti che fanno in un mese, ogni cliente avrà un profilo

diverso dall’altro. L’obiettivo potrebbe essere vedere se ci sono clienti simili per

acquisti che raggruppo. Posso quindi raggruppare i clienti in gruppi o classi. Questo

è funzionale al marketing perché se io trovo 20 diversi atteggiamenti di acquisto, mi

converrà fare 20 promozioni diverse a seconda del target così che sia più efficace.

L’interdipendenza devo studiarla in base alle unità statistiche che mi permette di

costruire delle classi di unità. Questa tecnica è chiamata cluster analysis (CA)

Questo è il riassunto di quello che vedremo. 2

1. Modelli statistici di dipendenza

L’obiettivo di un modello statistico di analisi della dipendenza è quello di studiare come varia

una determinata variabile Y (dipendente) in funzione del variare di alcune variabili x x x

1 2 k

(indipendenti o esplicative).

Esempio 1: Y= prezzo di vendita (quantitativa), X=superficie appartamento modello di

→

regressione.

Esempio 2: Y= mi piace/non mi piace fare acquisto in questo supermercato (qualitativa), X=

ritengo/non ritengo che il supermercato abbia una buona varietà di prodotti modello di

→

classificazione.

Esempio 3: Y= individuo assunto/non assunto dopo lo stage (qualitativa), X=punteggio al

test di ammissione allo stage modello di classificazione.

→

Nel modello di dipendenza in cui la Y è quantitativa devo fare y=f(x x … x ), devo trovare

1 2 k

una relazione tra X e Y.

Y=b +b x +…+b x , questa funzione matematica è un modello deterministico perché se io

0 1 1 k k

metto i valori delle X ottengo il valore delle Y. Date le X, mi restituisce un valore delle Y. La

realtà statistica però non è una realtà deterministica. Se osservo 100 famiglie con lo stesso

reddito, 4 persone e 2 persone laureate, osservo 100 valori della Y. Anche se ho gli stessi

valori di x x … x , avrò valori diversi di Y.

1 2 k

Lo statista risolve questo problema aggiungendo una variabile casuale W. Per ogni famiglia,

lancio un dado e aggiungo un valore casuale. Per risolvere questo problema quindi

aggiungo un termine aleatorio, che varia in modo casuale, che si aggiunge alla parte

funzionale. Diventa così un modello statistico. Y=b +b x +…+b x +W

0 1 1 k k

Il problema quando costruisco un modello statistico è posizionare il problema. È un

problema di dipendenza o di interdipendenza? Poi, devo scegliere un modello di

classificazione o di regressione? Se la Y è quantitativa, Regressione lineare, ANOVA o

AR(1). Poi, raccolgo i dati e stimo il modello. Devo passare da una relazione generica

(Y=b +b x +…+b x +W) a un modello stimato, in cui si sostituiscono i numeri, che ricavo

0 1 1 k k

sulla base dei dati osservati. Stimato il modello, non posso fermarmi. Questo è il modello

che suppongo stia dietro e che spieghi la mia X e Y. Devo misurare il grado di bontà del

modello, le previsioni quanto sono vicine alla realtà osservata. Se questo modello spiega

bene i dati osservati, che ci faccio? Posso utilizzare il modello o per un fine esplicativo

(cercare di capire quali sono le variabili che influiscono sulla mia Y e in che modo

influiscono), o previsivo (ma è un metodo limitato), o scenari (valori delle X ipotetiche e

vedere cosa accade, si usa nella scelta delle politiche economiche).

Se ho una Y e una X e entrambe sono numeriche, posso fare un grafico in cui ci sono dei

puntini.

Esempio: prezzo su superficie.

Qual è la f(x) da scegliere per collegare i valori di X alla Y. Se abbiamo solo due variabili, ci

aiutiamo col grafico. Un punto è individuato da due numeri. La f(x) che potremmo scegliere

tra le varie funzioni è una retta.

Il modello che scegliamo è Y=f(x)= b +b x.

0 1

Ma il modello non ci restituisce il valore di X osservato. Per la stessa superficie di

appartamento abbiamo diversi valori di Y. Per tenere conto di questa variazione di prezzi,

3

dobbiamo dire Y=f(x)= b +b x+W, un valore casuale che cambia di volta in volta. Tutta

0 1

questa funzione mi darà i valori dei prezzi degli appartamenti. Data una certa superficie,

avrò b +b x a cui si somma una variabile W.

0 1

La f(x) è lineare ma non sappiamo se è vero. Rimane da delineare che tipo di variabile

casuale è. Quindi la seconda ipotesi da fare riguarda la W.

In genere nei modelli di dipendenza abbiamo due gruppi di ipotesi: il primo riguarda che f(x)

scelgo, la seconda riguarda il comportamento della W. L’insieme delle ipotesi determina Y.

Intervento prof. Di Carlo (non registrato) 4

Lezione 2 (04/11/2025)

Ripartiamo dalla tabella di ieri

Innanzitutto dobbiamo chiarire che tipo di dati possiamo utilizzare. Abbiamo 3 tipi di dati:

1. Campione di osservazioni con cui colleziono più variabili. Immaginate un foglio Excel

in cui ogni riga è un'unità statistica, cioè uno di voi. E ogni colonna rappresenta le

informazioni raccolte su di voi. Quindi la prima colonna sarà riguardante il sesso

maschio femmina, la seconda colonna, l'età, la terza colonna dove vivete, quarta

colonna, eccetera eccetera. In questo caso parliamo di metodi per cross section o

sezionato (si tratta di applicare i metodi di dipendenza o interdipendenza a una

tabella di dati tipo Excel in colonne e righe).

2. Un’altra tipologia di dato, che sono tanti campioni osservati in più occasioni temporali,

in cui vado ad osservare sempre le stesse varianti. Colleziono campioni di dati che

differiscono per dimensione, ad esempio. Ciò che resta fisso è l’informazione che

viene raccolta. In questo caso parliamo di metodi per serie storiche o time series. Noi

nell'ambito della regressione, quindi dell'analisi della dipendenza, andiamo a vedere

un modello che serve ad analizzare le serie storiche, il modello AR(1). Quindi questo

modello serve quando i nostri dati sono organizzati in uno o più fenomeni osservati

in più occasioni temporali.

3. Infine, la terza tipologia ha diversi campioni, in diverse occasioni temporali ma le unità

statistiche che osservo nel primo campione rimangono le stesse anche nelle

successive occasioni. Questo è il metodo per osservazioni ripetute o panel data.

Che differenza c’è tra il secondo e il terzo tipo? Facciamo un esempio. Immaginiamo due

situazioni temporali (t e t ), elezioni politiche, e abbiamo sempre due candidati (A e B). In

1 2

genere non si aspetta il risultato definito ma si fanno degli exit pole.

Supponiamo di avere 100 campioni, elettori. Osservo che il 60% vota per A e il 40% per B.

Alle successive elezioni, si presentano sempre due candidati e utilizzo le stesse 100

persone e ho lo stesso risultato. 5

Se noi tracciamo la percentuale di A, cioè di voti dati al candidato A, passando da t a t

1 2

avremmo lo stesso risultato, quindi una retta. Così come l’andamento del candidato B.

Questa è un’analisi in serie storiche. Se ci fosse una terza occasione, avremo altri punti.

Quindi, di anno in anno vado a tracciare la quota di voti che prenderà. Vado a vedere

l’andamento del fenomeno longitudinalmente, rispetto al tempo.

Ma qui abbiamo un panel data, cioè queste percentuali si riferiscono alle preferenze date

sempre dagli stessi 100 individui, allora possiamo avere un’informazione in più e creare una

tabella, c.d. tabella di transizione.

Abbiamo 100 persone che hanno votato prima al t e poi al t . Da queste info, sappiamo che

1 2

al t le 100 persone si dividono in 60 che hanno votato A e 40 che hanno votato B; al t le

1 2

100 persone si dividono in 60 che hanno votato A e 40 che hanno votato B. Siccome queste

persone sono rimaste sempre le stesse, possiamo sapere la singola persona cosa ha votato

in t e poi in t . In questo modo possiamo disporre le persone all’interno della tabella.

1 2

Immaginiamo che la disposizione sia la seguente:

La tabella ci dice che quelli che nel t hanno votato B erano 40, al in t hanno cambiato

1 2

opinione e hanno votato A. Nel t A ha preso il 60 ma solo 20 hanno votato di nuovo per A

1

in t . C’è stata una rivoluzione. Se ci fermiamo alla serie storica diremmo che non è cambiato

2

nulla in t e in t , sempre 60 e 40 è il risultato. Tuttavia, andando a considerare la tabella di

1 2

transizione, mi rendo conto che qualcosa è accaduto sui flussi elettorali, cioè il passaggio

da un partito all’altro, da un’elezione all’altra. Questa cosa diventa molto informativa nelle

situazioni in cui sembra che non sia successo nulla.

I panel data permettono di scoprire cosa è accaduto dentro.

6

Dipendenza quantitativa, modello della regressione.

a) Regressione lineare semplice

C’è una sola variabile X, la Y è quantitativa.

b (intercetta) e b (coefficiente di regressione, se b >0 la nostra retta è crescente, la

0 1 1

relazione tra X e Y è diretta; se b <0 la nostra retta è decrescente, la relazione tra X e Y è

1

inversa) sono i nostri parametri.

W è il termine di errore o di disturbo.

Y= b +b x +W

0 1 1 i

Questo è un modello statistico, perché c’è il termine W di errore, non è una relazione

deterministica. In questo modello ho già messo un’ipotesi? Sì, perché? Perché la f(x)

generica l’ho scritta come b +b x, che è funzione di una retta. In questo modello si ipotizza

0 1

che la f(x), cioè la funzione matematica che lega i valori della Y ai valori della X, sia una

retta. Per questo regressione lineare.

La prima ipotesi è già fatta: il legame tra X e Y sia di tipo lineare. Questo si ricavava dal

grafico degli appartamenti della scorsa lezione.

Seconda ipotesi è la natura stocastica della W, cioè il suo comportamento aleatorio. Che

tipo di variabile è? Come si muove? Che valori mostra? Che variabilità ha? Che distribuzione

di probabilità ha? Per specificare un modello devo dire che la W ha questo comportamento

e questo tipo di variabile casuale.

W deve presentare i seguenti requisiti:

i - Il valore atteso di W è 0. E indica il valore atteso. I valori che può assumere la W

sono sia positivi che negativi.

- W deve essere omoschedastico (o omogeneo), la varianza deve rimanere

costante indipendentemente dai valori della X. Questo valore W, che può essere

positivo o negativo, ha una certa variabilità. Se ho 100 appartamenti, di 50 mq

(X), avremo 100 prezzi diversi perché W si aggiunge o si toglie. Questa ipotesi

dice che se prendo 100 appartamenti di 100 mq, W presenterà 100 valori casuali

i

con la stessa variabilità osservata per gli appartamenti di 50 mq.

- Questi valori di variabili casuali sono indipendenti l’uno dall’altro. Ogni volta

genera dei valori indipendenti, scollegati.

- È una variabile casuale normale. Vuol dire che è una variabile casuale continua,

quindi assume tutti i valori da + infinito a -infinito; tuttavia, questi valori hanno una

certa densità di probabilità che è data dalla funzione di densità di probabilità che

assume la forma campanulare.

Per riassumere: 7

W è una variabile casuale che si distribuisce come una normale, con media 0 e varianza

2

σ W. Quindi, graficamente, questa è la distribuzione di densità di probabilità di W, l’asse di

simmetria è centrata con il valore medio, è simmetrica rispetto a questo asse. La deviazione

standard corrisponde alla distanza tra l’asse di simmetria e il punto di flesso della curva. Se

questa è la legge che sta dietro questa variabile casuale, noi ci dobbiamo attendere che i

valori di W siano casuali ma intorno a 0. Valori molto piccoli o molto grandi sono rari.

Con questa assunzione abbiamo descritto qual è il comportamento di questo disturbo che

si aggiunge alla f(x).

Questa figura ci deve informare che alla f(x) si aggiunge/toglie qualcosa di abbastanza

piccolo, intorno a 0. Se la varianza dell’errore aumenta, alla forma di questa distribuzione

cosa cambia? Si appiattisce, si allungano le code e quindi aumenta la probabilità di

osservare valori molto piccoli o grandi.

2

σ rappresenta lo spread di valori possibili di W.

Per dargli ancora più significato a questa W, continuiamo. 2

Il volume del rumore, quanto è forte l’interferenza, è dato da σ . Se aumenta, è più probabile

2

osservare valori alti o piccoli di W. Distorcono molto il mio risult

Anteprima
Vedrai una selezione di 20 pagine su 112
Appunti lezione Metodi statistici per il management Pag. 1 Appunti lezione Metodi statistici per il management Pag. 2
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 6
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 11
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 16
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 21
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 26
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 31
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 36
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 41
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 46
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 51
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 56
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 61
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 66
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 71
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 76
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 81
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 86
Anteprima di 20 pagg. su 112.
Scarica il documento per vederlo tutto.
Appunti lezione Metodi statistici per il management Pag. 91
1 su 112
D/illustrazione/soddisfatti o rimborsati
Acquista con carta o PayPal
Scarica i documenti tutte le volte che vuoi
Dettagli
SSD
Scienze economiche e statistiche SECS-S/01 Statistica

I contenuti di questa pagina costituiscono rielaborazioni personali del Publisher ic2 di informazioni apprese con la frequenza delle lezioni di Metodi statistici per il management e studio autonomo di eventuali libri di riferimento in preparazione dell'esame finale o della tesi. Non devono intendersi come materiale ufficiale dell'università Università degli Studi di Roma Tor Vergata o del prof Borra Simone.
Appunti correlati Invia appunti e guadagna

Domande e risposte

Hai bisogno di aiuto?
Chiedi alla community