Cos’è il P-Value
Il p-value (valore p) è un concetto fondamentale nella statistica inferenziale che aiuta i ricercatori a decidere se i risultati di un esperimento sono statisticamente significativi o potrebbero essere dovuti al caso.
Definizione base
Il p-value rappresenta la probabilità di ottenere risultati uguali o più estremi di quelli osservati, assumendo che l’ipotesi nulla sia vera. L’ipotesi nulla è generalmente l’affermazione che “non c’è effetto” o “non c’è differenza”.
In termini più semplici, il p-value risponde alla domanda: “Se in realtà non ci fosse alcun effetto reale, quanto sarebbe probabile osservare dati come quelli che abbiamo raccolto, o ancora più estremi?”
Come interpretare il p-value
Un p-value piccolo (tipicamente inferiore a 0,05) suggerisce che i dati osservati sarebbero molto improbabili se l’ipotesi nulla fosse vera. Questo ci porta a “rifiutare l’ipotesi nulla” e concludere che c’è probabilmente un effetto reale.
Un p-value grande (tipicamente maggiore di 0,05) suggerisce che i dati osservati potrebbero ragionevolmente verificarsi anche se l’ipotesi nulla fosse vera. In questo caso, “non rifiutiamo l’ipotesi nulla”.
proviamo a spiegare il p-value in modo semplice con l’esempio classico del lancio della moneta:
Immagina di lanciare una moneta:
- Ipotesi nulla: La moneta è bilanciata (50% testa, 50% croce).
- Risultato: Lanci la moneta 10 volte e ottieni 9 teste.
Domanda: È normale o sospetto?
Il p-value ti aiuta a rispondere. Ti dice:
- “Se la moneta fosse davvero bilanciata, quanto sarebbe probabile ottenere 9 teste su 10 lanci?”
Il p-value è una probabilità:
- Un p-value basso (ad esempio, 0.01) significa che è molto improbabile ottenere quel risultato se l’ipotesi nulla fosse vera. Quindi, potresti iniziare a sospettare che la moneta sia truccata.
- Un p-value alto (ad esempio, 0.5) significa che è abbastanza comune ottenere quel risultato anche se l’ipotesi nulla fosse vera. Quindi, non hai motivo di dubitare che la moneta sia bilanciata.
In parole semplici:
- Il p-value ti dice quanto sono “strani” i tuoi risultati, supponendo che la tua ipotesi iniziale (l’ipotesi nulla) sia corretta.
- Più il p-value è basso, più è probabile che la tua ipotesi iniziale sia sbagliata.
Importante:
- Il p-value non ti dice quanto è “vera” un’ipotesi. Ti dice solo quanto sono probabili i tuoi risultati.
- Il p-value di 0.05 è un valore soglia comunemente usato. Se il p-value è inferiore a 0.05, si dice che il risultato è “statisticamente significativo”.
Un esempio originale: il caffè e la concentrazione
Immaginiamo che una piccola caffetteria locale voglia verificare se il loro nuovo caffè speciale migliora effettivamente la concentrazione, come sostengono.
Ipotesi nulla (H₀): Il caffè speciale non ha effetto sulla concentrazione.
Ipotesi alternativa (H₁): Il caffè speciale migliora la concentrazione.
La caffetteria recluta 30 volontari per un esperimento. Ogni volontario esegue un test di concentrazione due volte: una volta dopo aver bevuto il caffè speciale e una volta dopo aver bevuto un caffè normale (senza sapere quale sia quale).
Risultati dell’esperimento:
- 20 volontari hanno ottenuto punteggi migliori dopo il caffè speciale
- 10 volontari hanno ottenuto punteggi migliori dopo il caffè normale
Questo sembra promettente, ma potrebbe essere solo un caso? Qui entra in gioco il p-value.
Se calcoliamo il p-value per questi risultati (usando un test binomiale), otteniamo p = 0,049.
Questo significa che, se il caffè speciale non avesse davvero alcun effetto (ipotesi nulla), la probabilità di osservare 20 o più persone su 30 con punteggi migliori sarebbe solo del 4,9%.
Poiché questo p-value è inferiore alla soglia standard di 0,05, la caffetteria potrebbe ragionevolmente concludere che il loro caffè speciale probabilmente ha un effetto reale sulla concentrazione.
Un altro esempio: il metodo di studio
Un insegnante vuole verificare se un nuovo metodo di studio migliora i voti degli studenti.
Ipotesi nulla: Il nuovo metodo non influisce sui voti. Ipotesi alternativa: Il nuovo metodo migliora i voti.
L’insegnante divide casualmente la sua classe di 40 studenti in due gruppi:
- 20 studenti usano il metodo tradizionale
- 20 studenti usano il nuovo metodo
Dopo un esame, i risultati sono:
- Gruppo tradizionale: media 72/100, deviazione standard 8
- Gruppo nuovo metodo: media 75/100, deviazione standard 7
La differenza è di 3 punti. Ma è statisticamente significativa o potrebbe essere dovuta al caso?
Utilizzando un t-test indipendente, l’insegnante calcola un p-value di 0,21.
Questo significa che, se il nuovo metodo non avesse davvero alcun effetto (ipotesi nulla), ci sarebbe una probabilità del 21% di osservare una differenza di 3 punti o maggiore semplicemente per caso.
Poiché questo p-value è maggiore di 0,05, l’insegnante non può rifiutare l’ipotesi nulla. Non ci sono prove sufficienti per concludere che il nuovo metodo sia effettivamente migliore.
Cosa il p-value NON è
È importante chiarire alcuni malintesi comuni sul p-value:
- Il p-value NON è la probabilità che l’ipotesi nulla sia vera.
- Il p-value NON è la probabilità che i risultati siano dovuti al caso.
- Un p-value piccolo NON garantisce che l’effetto osservato sia importante o rilevante nella pratica.
- Un p-value grande NON prova che l’ipotesi nulla sia vera, ma solo che non abbiamo prove sufficienti per rifiutarla.
Un’analogia per comprendere meglio
Immagina di essere un giudice in un tribunale.
L’imputato è l’ipotesi nulla (presumibilmente innocente finché non si prova il contrario).
- Le prove contro l’imputato sono i tuoi dati sperimentali.
- Il p-value è come la probabilità che un innocente possa avere prove così incriminanti contro di sé.
- Una soglia di 0,05 significa che condanneresti l’imputato (rifiuteresti l’ipotesi nulla) solo se la probabilità che un innocente abbia tali prove contro di sé è inferiore al 5%.
Critiche al p-value: limiti e problemi di un concetto statistico fondamentale
Nonostante la sua popolarità e diffusione, il p-value è stato oggetto di numerose critiche da parte della comunità scientifica e statistica. Queste critiche hanno portato alcuni ricercatori e riviste scientifiche a riconsiderare il modo in cui utilizziamo questo strumento statistico. Vediamo le principali problematiche:
1. Interpretazione errata e abuso
Uno dei problemi più comuni è che il p-value viene spesso frainteso. Molti ricercatori lo interpretano erroneamente come:
- La probabilità che l’ipotesi nulla sia vera
- La probabilità che i risultati siano dovuti al caso
- Un indicatore della forza o dell’importanza dell’effetto osservato
Questi fraintendimenti portano a conclusioni errate e decisioni potenzialmente dannose. Ad esempio, un p-value di 0,04 non significa che c’è una probabilità del 96% che l’effetto osservato sia reale.
2. La soglia arbitraria dello 0,05
La soglia convenzionale di significatività statistica (p < 0,05) è stata stabilita quasi arbitrariamente da Ronald Fisher negli anni ’20. Non esiste una base teorica solida per cui proprio il 5% dovrebbe essere la soglia decisiva. Questo ha portato a situazioni assurde in cui:
- Un risultato con p = 0,049 viene considerato “significativo”
- Un risultato con p = 0,051 viene considerato “non significativo”
Nonostante la differenza tra questi valori sia minima, le conclusioni tratte possono essere drasticamente diverse.
3. Il problema del “p-hacking”
Il p-hacking (o “fishing for significance”) si verifica quando i ricercatori manipolano i dati o le analisi fino a ottenere un p-value inferiore a 0,05. Questo può includere:
- Analizzare i dati in diversi modi e riportare solo quelli che danno risultati significativi
- Raccogliere dati finché non si raggiunge la significatività
- Eliminare “outlier” selettivamente
- Testare multiple variabili dipendenti e riportare solo quelle significative
- Dividere i dati in sottogruppi dopo averli raccolti (analisi post-hoc)
Un esempio pratico: immagina un ricercatore che studia se un particolare tè migliora il benessere. Potrebbe misurare 20 diversi indicatori di salute. Per puro caso, è probabile che almeno uno di questi indicatori mostrerà un “miglioramento significativo” con p < 0,05, anche se il tè non ha alcun effetto reale.
4. La crisi della riproducibilità
La dipendenza eccessiva dal p-value ha contribuito alla “crisi della riproducibilità” in molti campi scientifici. Studi che mostrano risultati statisticamente significativi hanno maggiori probabilità di essere pubblicati, creando un forte “publication bias”.
Un esempio famoso: nel 2015, un gruppo di ricercatori ha tentato di replicare 100 studi psicologici pubblicati in prestigiose riviste scientifiche. Solo il 36% degli studi ha prodotto risultati simili agli originali, nonostante gli studi originali avessero p-value inferiori a 0,05.
5. Dipendenza dalla dimensione del campione
Il p-value è fortemente influenzato dalla dimensione del campione. Con campioni molto grandi, anche effetti minuscoli e praticamente irrilevanti possono risultare “statisticamente significativi”.
Esempio: in uno studio con 100.000 partecipanti, una differenza di pressione sanguigna di appena 1 mmHg potrebbe risultare “statisticamente significativa” (p < 0,05), anche se clinicamente è del tutto irrilevante.
6. Non considera l’ampiezza dell’effetto
Il p-value non ci dice nulla sull’ampiezza dell’effetto osservato o sulla sua rilevanza pratica. Un effetto può essere statisticamente significativo ma troppo piccolo per avere importanza nel mondo reale.
Esempio: un nuovo farmaco antidolorifico potrebbe ridurre il dolore del 2% rispetto al placebo con p = 0,01. È statisticamente significativo, ma probabilmente non abbastanza efficace per giustificare l’uso clinico o i possibili effetti collaterali.
7. Non incorpora la conoscenza precedente
Il p-value non tiene conto delle informazioni o teorie precedenti. Ogni test viene considerato isolatamente, come se partissimo sempre da zero.
Esempio: se testiamo un trattamento omeopatico che secondo le leggi della fisica e della chimica non dovrebbe avere effetti, un p-value di 0,04 dovrebbe essere interpretato molto diversamente rispetto allo stesso p-value per un trattamento con un meccanismo d’azione plausibile.
8. Alternative e possibili soluzioni
In risposta a queste critiche, sono state proposte diverse alternative o integrazioni:
- Intervalli di confidenza: forniscono informazioni sull’ampiezza dell’effetto e la precisione della stima
- Dimensione dell’effetto: misure come il Cohen’s d o l’odds ratio che quantificano l’ampiezza dell’effetto osservato
- Analisi bayesiana: incorpora la conoscenza precedente e fornisce la probabilità che un’ipotesi sia vera dato ciò che osserviamo
- Preregistrazione degli studi: specificare in anticipo le analisi che verranno condotte
- Meta-analisi: combinare i risultati di più studi per ottenere stime più affidabili
Un esempio illuminante
Immagina un detector di bugie che sia accurato all’80%. Se testiamo 1000 persone innocenti, circa 200 (il 20%) risulteranno falsamente positive. Se testiamo 10 colpevoli, circa 8 (l’80%) risulteranno correttamente positive.
In totale avremo 208 test positivi, ma solo 8 di questi saranno veri positivi. Quindi, nonostante il test sia “significativo” (p = 0,20), la probabilità che una persona con test positivo sia effettivamente colpevole è solo del 3,8% (8/208).
Questo mostra come un test con un p-value relativamente basso possa comunque portare a molte conclusioni errate se non consideriamo altri fattori come la prevalenza del fenomeno che stiamo studiando.
Conclusione
Il p-value rimane uno strumento utile nella ricerca scientifica, ma le sue limitazioni suggeriscono che dovrebbe essere utilizzato come uno dei tanti indicatori, non come l’arbitro finale della verità scientifica. Un approccio più completo dovrebbe includere la valutazione della dimensione dell’effetto, la rilevanza pratica, la coerenza con la teoria esistente e la riproducibilità dei risultati.
La comunità scientifica sta gradualmente passando da un approccio binario (significativo/non significativo) a un approccio più sfumato e completo nell’interpretazione dei risultati statistici, e questo è sicuramente un passo nella giusta direzione.
Articoli di approfondimento
- 👉 Statistica per Data Science: esercizi di base e fondamenti teorici
- 👉 Guida pratica al T-test di Welch: esercizi e soluzioni passo-passo
- 👉 Test T di Welch: guida completa con esercizi risolti
- 👉 Il test-T per dati appaiati
- 👉 Test T appaiato: esempio, calcoli e codice Python (SciPy)
- 👉 Teorema del limite centrale (TLC): guida completa con esempi Python ed eccezioni
- 👉 Statistica inferenziale: 8 esercizi progressivi (Z-test, T-test, p-value e potenza)





