Inizia subitoInizia gratis

Usare le visualizzazioni: lmplot

Creare grafici di modelli lineari aiuta a capire se le variabili hanno relazioni con la variabile dipendente. Se sì, sono buone candidate da includere nell’analisi. Se no, non significa che vadano scartate: potrebbe essere necessario elaborararle o ripulirle prima di poterle usare.

seaborn è disponibile nel tuo workspace con il consueto alias sns.

Questo esercizio fa parte del corso

Feature Engineering con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Usando l’insieme di dati caricato df, filtra mantenendo solo le colonne 'SALESCLOSEPRICE' e 'LIVINGAREA' con select().
  • Campiona il 50% del DataFrame con sample(), assicurandoti di non usare il reinserimento e impostando il seed casuale a 42.
  • Converte il DataFrame di Spark in un pandas.DataFrame() con toPandas().
  • Usando 'SALESCLOSEPRICE' come variabile dipendente e 'LIVINGAREA' come variabile indipendente, traccia un grafico del modello lineare con lmplot() di seaborn.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)

# Convert to pandas dataframe
pandas_df = sample_df.____()

# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()
Modifica ed esegui il codice