Guida Pratica a Correlazione e Regressione Lineare: Esercizi Svolti e Applicazioni Reali

Cerca:

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors
differenza tra correlazione e causalitĂ  esercizi svolti

Quante volte, in riunione o leggendo un report, hai sentito frasi come “c’è una chiara correlazione tra le nostre campagne e le vendite” oppure “i dati suggeriscono un legame”? Spesso, queste affermazioni restano sospese a mezz’aria, intuizioni brillanti ma prive di un fondamento numerico solido. E se potessi essere tu la persona che, con calma e sicurezza, mostra esattamente quanto è forte quel legame?

Questo articolo non è una lezione teorica astratta. È un percorso pratico, una vera e propria palestra per imparare a usare due degli strumenti piĂš potenti nell’analisi dei dati: la correlazione e la regressione lineare. Attraverso tre esempi concreti e realistici — dal rendimento scolastico alle vendite di un e-commerce — vedremo non solo come si fanno i calcoli, ma soprattutto cosa significano quei numeri e come possono guidare decisioni strategiche. Preparati a trasformare le intuizioni in certezze.

Esercizio 1: L’Influenza del Tempo di Studio sui Voti

Un insegnante di matematica vuole capire se esiste una relazione tra il tempo che i suoi studenti dedicano allo studio a casa per la sua materia e il voto che ottengono nella verifica finale. Ha raccolto i dati per 8 studenti, registrando le ore di studio settimanali medie e il voto (su 10) ottenuto:

Tabella Dati

Studente Ore di Studio (X) Voto (Y)
A 3 5
B 5 7
C 2 4
D 6 8
E 4 6
F 7 9
G 1 3
H 5 7
  1. Costruisci un diagramma a dispersione (scatterplot) per visualizzare la relazione tra le ore di studio e il voto.
  2. Basandoti sul diagramma, descrivi la direzione e la forza apparente della relazione.
  3. Calcola il coefficiente di correlazione di Pearson (r) per questi dati.
  4. Interpreta il valore di r ottenuto nel contesto del problema.

Soluzione passo-passo

1. Costruzione del diagramma a dispersione

Per costruire il diagramma a dispersione, rappresentiamo ogni coppia (Ore di Studio, Voto) come un punto su un grafico cartesiano, dove l’asse orizzontale (X) rappresenta le ore di studio e l’asse verticale (Y) rappresenta il voto.

Spiegazione didattica: Il diagramma a dispersione (o scatterplot) è il primo strumento visivo per esplorare la relazione tra due variabili quantitative. Ogni punto sul grafico rappresenta un’osservazione (in questo caso, uno studente) con i suoi valori per entrambe le variabili. Ci aiuta a identificare rapidamente la direzione (se i punti tendono a salire o scendere) e la forza (quanto i punti sono raggruppati attorno a una linea immaginaria) di una possibile relazione.

2. Descrizione della relazione dal diagramma

Osservando il diagramma a dispersione, si nota che i punti tendono a salire da sinistra a destra, formando una sorta di nuvola allungata. Questo suggerisce una relazione positiva e piuttosto forte: all’aumentare delle ore di studio, tende ad aumentare anche il voto.

Spiegazione didattica:

  • Direzione: Se i punti salgono da sinistra a destra, la correlazione è positiva (all’aumentare di X, aumenta Y). Se scendono, è negativa (all’aumentare di X, diminuisce Y). Se non c’è un pattern chiaro, è nulla.
  • Forza: Quanto piĂš i punti sono vicini a formare una linea retta, tanto piĂš forte è la correlazione. Se sono molto sparsi, la correlazione è debole.

3. Calcolo del coefficiente di correlazione di Pearson (r)

Il coefficiente di correlazione di Pearson (r) misura la forza e la direzione di una relazione lineare tra due variabili quantitative. La formula è:

[math]r = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sqrt{\sum (X_i – \bar{X})^2 \sum (Y_i – \bar{Y})^2}}[/math]

Dove:

  • [math]X_i[/math] e [math]Y_i[/math] sono i singoli valori delle variabili.
  • [math]\bar{X}[/math] e [math]\bar{Y}[/math] sono le medie delle variabili.
  • [math]\sum[/math] indica la somma di tutti i valori.

Calcoliamo i valori intermedi necessari:

Calcoliamo le medie:

[math]\bar{X} = (3+5+2+6+4+7+1+5) / 8 = 33 / 8 = 4.125[/math]

[math]\bar{Y} = (5+7+4+8+6+9+3+7) / 8 = 49 / 8 = 6.125[/math]

Ora completiamo la tabella:

Studente X Y [math]X – \bar{X}[/math] [math]Y – \bar{Y}[/math] [math](X – \bar{X})(Y – \bar{Y})[/math] [math](X – \bar{X})^2[/math] [math](Y – \bar{Y})^2[/math]
A 3 5 -1.125 -1.125 1.265625 1.265625 1.265625
B 5 7 0.875 0.875 0.765625 0.765625 0.765625
C 2 4 -2.125 -2.125 4.515625 4.515625 4.515625
D 6 8 1.875 1.875 3.515625 3.515625 3.515625
E 4 6 -0.125 -0.125 0.015625 0.015625 0.015625
F 7 9 2.875 2.875 8.265625 8.265625 8.265625
G 1 3 -3.125 -3.125 9.765625 9.765625 9.765625
H 5 7 0.875 0.875 0.765625 0.765625 0.765625
Somma 33 49 0 0 28.875 28.875 28.875
Media 4.125 6.125

Ora applichiamo la formula:

[math]r = \frac{28.875}{\sqrt{28.875 \times 28.875}} = \frac{28.875}{28.875} = \mathbf{1}[/math]

Spiegazione didattica: Il coefficiente di correlazione di Pearson (r) varia tra -1 e +1.

  • [math]r = +1[/math]: Indica una correlazione lineare positiva perfetta. Tutti i punti giacciono su una retta con pendenza positiva.
  • [math]r = -1[/math]: Indica una correlazione lineare negativa perfetta. Tutti i punti giacciono su una retta con pendenza negativa.
  • [math]r = 0[/math]: Indica assenza di correlazione lineare. Non c’è una relazione lineare tra le variabili.
  • Valori intermedi (es. 0.7, -0.5): Indicano correlazioni piĂš o meno forti. PiĂš il valore si avvicina a +1 o -1, piĂš forte è la correlazione.
Forse potrebbe interessarti anche:  Test t Appaiato: Guida Pratica con Esempio, Calcoli e Codice Python (SciPy)

4. Interpretazione del valore di r

Il coefficiente di correlazione di Pearson calcolato è [math]r = 1[/math]. Questo indica una correlazione lineare positiva perfetta tra le ore di studio e il voto. In altre parole, in questo specifico set di dati, ogni aumento nelle ore di studio corrisponde a un aumento proporzionale e costante nel voto. È una situazione ideale e rara nella realtà, ma utile per comprendere il significato di una correlazione perfetta.

Osservazione strategica: Correlazione vs. CausalitĂ 

È fondamentale ricordare che la correlazione non implica causalitĂ . Anche se in questo esercizio abbiamo trovato una correlazione perfetta, non possiamo affermare con certezza che le ore di studio causino direttamente il voto. Potrebbero esserci altri fattori (variabili confondenti) che influenzano entrambi, come l’intelligenza innata dello studente, la qualitĂ  dell’insegnamento, la motivazione, ecc. La correlazione indica solo che le due variabili tendono a muoversi insieme in un certo modo. Per stabilire una relazione di causalitĂ , sarebbero necessari studi piĂš approfonditi, come esperimenti controllati.

La caratteristica piĂš interessante qui è il risultato finale: un coefficiente di correlazione r = 1. Questo rappresenta una correlazione lineare positiva perfetta. Nella vita reale, è quasi impossibile trovare una correlazione perfetta a causa della miriade di fattori che influenzano qualsiasi fenomeno. Questo esercizio è un “caso da manuale” ideale: è stato costruito appositamente per essere perfetto, rendendo il calcolo pulito e il concetto di “correlazione perfetta” immediatamente comprensibile per uno studente.

Sebbene irrealistico, questo esercizio è pedagogicamente potentissimo. Serve a mostrare il “tetto massimo” della correlazione. Nella pratica, un ricercatore in scienze dell’educazione o uno psicologo scolastico che trovasse un valore anche solo di r = 0.7 sarebbe entusiasta. L’esercizio insegna a stabilire un punto di riferimento: piĂš il nostro r si avvicina a 1, piĂš la relazione che stiamo studiando assomiglia a questo caso ideale.

Esercizio 2: Consumo di Gelato e Temperatura Esterna

Un piccolo chiosco di gelati vuole analizzare la relazione tra la temperatura esterna media giornaliera e il numero di gelati venduti in un giorno. Ha raccolto i dati per 7 giorni scelti a caso durante l’estate:

Tabella Dati

Giorno Temperatura (°C) (X) Gelati Venduti (Y)
1 20 150
2 25 220
3 18 130
4 28 250
5 22 180
6 26 230
7 19 140
  1. Costruisci un diagramma a dispersione per visualizzare la relazione tra la temperatura e i gelati venduti.
  2. Basandoti sul diagramma, descrivi la direzione e la forza apparente della relazione.
  3. Calcola il coefficiente di correlazione di Pearson (r) per questi dati.
  4. Interpreta il valore di r ottenuto e discuti se la correlazione implica che il caldo causi un aumento delle vendite.

Soluzione passo-passo

1. Costruzione del diagramma a dispersione

Rappresentiamo ogni coppia (Temperatura, Gelati Venduti) come un punto su un grafico cartesiano. L’asse X sarĂ  la temperatura e l’asse Y i gelati venduti.

Spiegazione didattica: Anche in questo caso, il diagramma a dispersione ci fornisce una prima intuizione visiva. È fondamentale per capire se la relazione è lineare o se ci sono pattern non lineari o outlier evidenti prima di procedere con calcoli piÚ complessi.

2. Descrizione della relazione dal diagramma

Osservando il diagramma a dispersione, si può notare che i punti tendono a raggrupparsi lungo una linea immaginaria che sale da sinistra a destra. Questo indica una relazione positiva e piuttosto forte: all’aumentare della temperatura, tende ad aumentare anche il numero di gelati venduti.

Spiegazione didattica: Una relazione positiva significa che le due variabili si muovono nella stessa direzione. Se una aumenta, anche l’altra tende ad aumentare. Se una diminuisce, anche l’altra tende a diminuire. La forza è data da quanto i punti sono vicini a formare una linea retta.

3. Calcolo del coefficiente di correlazione di Pearson (r)

Useremo la stessa formula dell’Esercizio 1:

[math]r = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sqrt{\sum (X_i – \bar{X})^2 \sum (Y_i – \bar{Y})^2}}[/math]

Calcoliamo le medie:

[math]\bar{X} = (20+25+18+28+22+26+19) / 7 = 158 / 7 \approx 22.57[/math]
[math]\bar{Y} = (150+220+130+250+180+230+140) / 7 = 1300 / 7 \approx 185.71[/math]

Ora costruiamo la tabella con i valori intermedi:

Giorno X Y [math]X – \bar{X}[/math] [math]Y – \bar{Y}[/math] [math](X – \bar{X})(Y – \bar{Y})[/math] [math](X – \bar{X})^2[/math] [math](Y – \bar{Y})^2[/math]
1 20 150 -2.57 -35.71 91.88 6.60 1275.20
2 25 220 2.43 34.29 83.33 5.90 1175.80
3 18 130 -4.57 -55.71 254.76 20.88 3103.60
4 28 250 5.43 64.29 349.04 29.50 4133.20
5 22 180 -0.57 -5.71 3.26 0.32 32.60
6 26 230 3.43 44.29 152.00 11.76 1961.60
7 19 140 -3.57 -45.71 163.26 12.74 2089.40
Somma 158 1300 0 0 1097.53 87.70 13771.40

Applichiamo la formula:

[math]r = \frac{1097.53}{\sqrt{87.70 \times 13771.40}} = \frac{1097.53}{\sqrt{1207960.98}} = \frac{1097.53}{1099.07} \approx \mathbf{0.9986}[/math]

Spiegazione didattica: Un valore di r molto vicino a +1 (come 0.9986) indica una correlazione lineare positiva estremamente forte. Questo significa che le due variabili si muovono quasi perfettamente insieme in una relazione lineare diretta.

4. Interpretazione del valore di r e discussione sulla causalitĂ 

Il coefficiente di correlazione di Pearson di circa 0.9986 indica una correlazione lineare positiva molto forte tra la temperatura esterna e il numero di gelati venduti. Questo significa che, per i dati osservati, all’aumentare della temperatura, il numero di gelati venduti aumenta quasi proporzionalmente.

Forse potrebbe interessarti anche:  Distribuzione Gamma: La Guida Pratica per Modellare Tempi e Valori Positivi (con Esempi e Codice Python)

Discussione sulla CausalitĂ :

In questo caso, è molto probabile che ci sia una relazione causale diretta: una temperatura piĂš alta causa un maggiore desiderio di rinfrescarsi, portando a un aumento delle vendite di gelati. Tuttavia, è importante essere cauti. Anche se la relazione causale sembra intuitiva e logica, la correlazione da sola non la prova. Potrebbero esserci altri fattori che contribuiscono (es. eventi estivi, vacanze, ecc.), ma la temperatura è chiaramente un fattore determinante. Questo esempio serve a sottolineare che, sebbene la correlazione non implichi sempre causalitĂ , in alcuni contesti la logica e la conoscenza del dominio possono suggerire una relazione causale plausibile. La statistica fornisce gli strumenti per misurare la relazione, ma l’interpretazione richiede anche un’analisi critica del contesto.

Qui il coefficiente r ≈ 0.9986 è estremamente alto, quasi perfetto. La peculiaritĂ  è che, a differenza del primo esercizio, questo scenario è altamente plausibile. La relazione tra caldo e consumo di gelato è una delle piĂš intuitive e dirette che si possano immaginare. Questo lo rende l’esempio perfetto per discutere la differenza tra correlazione e causalitĂ . Sebbene la statistica da sola non possa dimostrare la causalitĂ , la nostra conoscenza del mondo (il “dominio”) ci permette di affermare con ragionevole certezza che il caldo causa un aumento delle vendite.

Questo è un classico problema di previsione della domanda (demand forecasting). Il proprietario del chiosco può usare questo modello per decidere quanto gelato produrre o quante persone mettere al turno di lavoro basandosi sulle previsioni meteo. Se il meteo prevede 30°C, può inserire questo valore nel suo modello di regressione (che qui non abbiamo calcolato, ma che sarebbe il passo successivo) per stimare le vendite e ottimizzare le scorte, evitando sprechi o mancate vendite.

PubblicitĂ 
PubblicitĂ 

Esercizio 3: Spesa Pubblicitaria e Vendite Mensili

Un’azienda di e-commerce vuole capire l’efficacia della sua spesa pubblicitaria online sulle vendite mensili. Ha raccolto i dati per gli ultimi 10 mesi, registrando la spesa in migliaia di euro (X) e le vendite in migliaia di euro (Y):

Tabella Dati

Mese Spesa Pubblicitaria (X) Vendite Mensili (Y)
1 10 120
2 12 140
3 8 100
4 15 160
5 11 130
6 13 150
7 9 110
8 14 155
9 10 125
10 16 170
  1. Calcola il coefficiente di correlazione di Pearson (r) per questi dati.
  2. Determina l’equazione della retta di regressione lineare ([math]Y = a + bX[/math]) che meglio descrive la relazione tra spesa pubblicitaria e vendite.
  3. Interpreta il coefficiente angolare (b) e l’intercetta (a) della retta di regressione.
  4. Calcola e interpreta il coefficiente di determinazione ([math]R^2[/math]).
  5. Se l’azienda decidesse di spendere 18 mila euro in pubblicitĂ  il prossimo mese, quante vendite ci si aspetterebbe?

Soluzione passo-passo

1. Calcolo del coefficiente di correlazione di Pearson (r)

Per il calcolo di r, useremo la stessa formula degli esercizi precedenti. Iniziamo calcolando le medie di X e Y.

[math]\bar{X} = (10+12+8+15+11+13+9+14+10+16) / 10 = 118 / 10 = 11.8[/math]
[math]\bar{Y} = (120+140+100+160+130+150+110+155+125+170) / 10 = 1360 / 10 = 136[/math]

Ora, costruiamo la tabella per i calcoli intermedi:

Mese X Y [math]X – \bar{X}[/math] [math]Y – \bar{Y}[/math] [math](X – \bar{X})(Y – \bar{Y})[/math] [math](X – \bar{X})^2[/math] [math](Y – \bar{Y})^2[/math]
1 10 120 -1.8 -16 28.8 3.24 256
2 12 140 0.2 4 0.8 0.04 16
3 8 100 -3.8 -36 136.8 14.44 1296
4 15 160 3.2 24 76.8 10.24 576
5 11 130 -0.8 -6 4.8 0.64 36
6 13 150 1.2 14 16.8 1.44 196
7 9 110 -2.8 -26 72.8 7.84 676
8 14 155 2.2 19 41.8 4.84 361
9 10 125 -1.8 -11 19.8 3.24 121
10 16 170 4.2 34 142.8 17.64 1156
Somma 118 1360 0 0 547.2 68.16 4690

Applichiamo la formula per r:

[math]r = \frac{547.2}{\sqrt{68.16 \times 4690}} = \frac{547.2}{\sqrt{319694.4}} = \frac{547.2}{565.415} \approx \mathbf{0.9678}[/math]

Spiegazione didattica: Un valore di r di circa 0.9678 indica una correlazione lineare positiva molto forte. Questo suggerisce che c’è una relazione quasi diretta tra la spesa pubblicitaria e le vendite: all’aumentare della spesa, le vendite tendono ad aumentare in modo significativo e lineare.

2. Determinazione dell’equazione della retta di regressione lineare ([math]Y = a + bX[/math])

La retta di regressione lineare è la linea che meglio si adatta ai dati in un diagramma a dispersione, minimizzando la somma dei quadrati delle distanze verticali tra i punti e la retta (metodo dei minimi quadrati). I coefficienti ‘a’ (intercetta) e ‘b’ (coefficiente angolare o pendenza) si calcolano come segue:

[math]b = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sum (X_i – \bar{X})^2}[/math]
[math]a = \bar{Y} – b\bar{X}[/math]

Usando i valori calcolati nella tabella:

[math]b = \frac{547.2}{68.16} \approx \mathbf{8.028}[/math]

[math]a = 136 – (8.028 \times 11.8) = 136 – 94.7304 \approx \mathbf{41.2696}[/math]

Quindi, l’equazione della retta di regressione è: [math]\mathbf{Y = 41.27 + 8.03X}[/math]

Spiegazione didattica:

  • Regressione Lineare Semplice: È un modello statistico che cerca di descrivere la relazione tra una variabile dipendente (Y, in questo caso le vendite) e una variabile indipendente (X, la spesa pubblicitaria) attraverso una linea retta. È utile per prevedere i valori di Y basandosi sui valori di X.
  • Metodo dei Minimi Quadrati: Questo metodo garantisce che la retta trovata sia quella che minimizza la somma dei quadrati degli errori (le differenze tra i valori osservati di Y e quelli predetti dalla retta).
Forse potrebbe interessarti anche:  Test t di Student: Esercizi Pratici Risolti e Commentati per l'Azienda

3. Interpretazione del coefficiente angolare (b) e dell’intercetta (a)

  • Coefficiente angolare (b ≈ 8.03): Questo valore indica che per ogni aumento di 1 unitĂ  nella spesa pubblicitaria (1 migliaio di euro), le vendite mensili previste aumentano di circa 8.03 unitĂ  (8.03 migliaia di euro). In altre parole, ogni 1000 euro spesi in pubblicitĂ  sono associati a un aumento medio di 8030 euro nelle vendite.
  • Intercetta (a ≈ 41.27): Questo valore rappresenta il valore previsto delle vendite mensili quando la spesa pubblicitaria è pari a zero. In questo contesto, significa che, secondo il modello, l’azienda si aspetterebbe vendite di circa 41.27 migliaia di euro anche senza alcuna spesa pubblicitaria. Tuttavia, l’interpretazione dell’intercetta deve essere fatta con cautela, specialmente se il valore di X=0 non è significativo o non rientra nel range dei dati osservati.

4. Calcolo e interpretazione del coefficiente di determinazione ([math]R^2[/math])

Il coefficiente di determinazione ([math]R^2[/math]) misura la proporzione della varianza totale della variabile dipendente (Y) che è spiegata dalla variabile indipendente (X) attraverso il modello di regressione lineare. Si calcola come il quadrato del coefficiente di correlazione di Pearson:

[math]R^2 = r^2[/math]
[math]R^2 = (0.9678)^2 \approx \mathbf{0.9366}[/math]

Interpretazione: Un [math]R^2[/math] di circa 0.9366 (o 93.66%) significa che il 93.66% della variabilità nelle vendite mensili può essere spiegato dalla variabilità nella spesa pubblicitaria. Il restante 6.34% è dovuto ad altri fattori non inclusi nel modello o a variabilità casuale.

Spiegazione didattica: [math]R^2[/math] è un indicatore molto importante della bontà di adattamento del modello. Un valore di [math]R^2[/math] vicino a 1 indica che il modello spiega una grande parte della variabilità della variabile dipendente, suggerendo che la variabile indipendente è un buon predittore. Un valore vicino a 0 indica che il modello spiega poco o nulla della variabilità.

5. Previsione delle vendite con una spesa di 18 mila euro

Per prevedere le vendite, sostituiamo [math]X = 18[/math] nell’equazione della retta di regressione:

[math]\displaystyle \begin{aligned} Y &= 41.27 + 8.03 \times 18 \\ &= 41.27 + 144.54 \\ &= \mathbf{185.81} \end{aligned}[/math]

Si prevede che, con una spesa pubblicitaria di 18 mila euro, le vendite mensili saranno di circa 185.81 migliaia di euro (ovvero 185.810 euro).

Osservazione strategica: Estrapolazione

È importante notare che la previsione per [math]X=18[/math] è un’estrapolazione, poichĂŠ 18 mila euro è al di fuori del range di spesa pubblicitaria osservato nei dati originali (che va da 8 a 16 mila euro). Le estrapolazioni devono essere considerate con cautela, poichĂŠ la relazione lineare potrebbe non mantenersi valida al di fuori del range dei dati osservati. Il modello è piĂš affidabile per interpolazioni (previsioni all’interno del range dei dati).

Questo è l’esercizio piĂš completo e rappresentativo di un’analisi di business reale.

Le sue peculiaritĂ  sono:

Va oltre la correlazione: Introduce la regressione lineare, fornendo un modello predittivo (Y = 41.27 + 8.03X).

Quantifica l’impatto: Il coefficiente b = 8.03 non dice solo che “c’è una relazione”, ma che “per ogni 1000€ in piĂš in pubblicitĂ , ci aspettiamo 8030€ in piĂš di vendite”. Questo è un KPI (Key Performance Indicator) azionabile.

Introduce R²: Il coefficiente di determinazione (R² ≈ 93.66%) spiega la bontà del modello. Ci dice che il nostro modello è molto robusto, perché la spesa pubblicitaria da sola spiega quasi il 94% della variazione delle vendite.

Usa l’estrapolazione: La previsione per X=18 è un’estrapolazione (previsione al di fuori del range dei dati noti). L’esercizio evidenzia implicitamente i rischi di questa pratica, un punto cruciale nelle applicazioni reali.

Questo esercizio è un’applicazione diretta di Marketing Analytics e Business Intelligence. Un’azienda usa esattamente questo tipo di analisi per giustificare i budget pubblicitari, per decidere su quali canali investire e per fissare gli obiettivi di vendita. L’interpretazione dei coefficienti a e b è fondamentale: l’intercetta a rappresenta la “base di vendite” che l’azienda ha anche senza pubblicitĂ  (es. grazie al brand, al passaparola), mentre b misura l’efficacia marginale di ogni euro speso in advertising.

Conclusione

Siamo partiti da semplici punti su un grafico e siamo arrivati a costruire un modello in grado di fare previsioni economiche. Correlazione e regressione non sono formule da imparare a memoria, ma lenti di ingrandimento per leggere la realtĂ  nascosta nei dati.

Il prossimo passo? Esplorare come piĂš variabili indipendenti possono influenzare un risultato, aprendo le porte alla regressione multipla. Ma per oggi, hai giĂ  acquisito una competenza fondamentale per chiunque voglia lavorare con i dati in modo serio e professionale.

PubblicitĂ