Usare le visualizzazioni: lmplot
Creare grafici di modelli lineari aiuta a capire se le variabili hanno relazioni con la variabile dipendente. Se sì, sono buone candidate da includere nell’analisi. Se no, non significa che vadano scartate: potrebbe essere necessario elaborararle o ripulirle prima di poterle usare.
seaborn è disponibile nel tuo workspace con il consueto alias sns.
Questo esercizio fa parte del corso
Feature Engineering con PySpark
Istruzioni dell'esercizio
- Usando l’insieme di dati caricato
df, filtra mantenendo solo le colonne 'SALESCLOSEPRICE' e 'LIVINGAREA' conselect(). - Campiona il 50% del DataFrame con
sample(), assicurandoti di non usare il reinserimento e impostando il seed casuale a 42. - Converte il DataFrame di Spark in un
pandas.DataFrame()contoPandas(). - Usando 'SALESCLOSEPRICE' come variabile dipendente e 'LIVINGAREA' come variabile indipendente, traccia un grafico del modello lineare con
lmplot()di seaborn.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)
# Convert to pandas dataframe
pandas_df = sample_df.____()
# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()