Approfondimento: correlazione
Se hai dimestichezza con la statistica, avrai sentito parlare della correlazione di Pearson. È una misura che valuta la dipendenza lineare tra due variabili, diciamo \(X\) e \(Y\). Può variare da -1 a 1; se è vicina a 1 significa che c’è una forte associazione positiva tra le variabili. Se \(X\) è alta, anche \(Y\) tende a essere alta. Se è vicina a -1, c’è una forte associazione negativa: se \(X\) è alta, \(Y\) tende a essere bassa. Quando la correlazione di Pearson tra due variabili è 0, queste variabili sono possibilmente indipendenti: non c’è associazione tra \(X\) e \(Y\).
Puoi calcolare la correlazione tra due vettori con la funzione cor(). Prendi ad esempio questo codice, che calcola la correlazione tra le colonne height e width di un ipotetico data frame size:
cor(size$height, size$width)
I dati con cui hai lavorato nell’esercizio precedente, international.sav, sono di nuovo disponibili nella tua directory di lavoro. Ora tocca a te importarli ed eseguire i calcoli corretti per rispondere alla seguente domanda:
Qual è il coefficiente di correlazione per le due variabili numeriche gdp e f_illit (tasso di analfabetismo femminile)?
Questo esercizio fa parte del corso
Importazione intermedia di dati in R
esercizio interattivo pratico
Trasforma la teoria in pratica con uno dei nostri esercizi interattivi
Inizia esercizio