Kom igångKom igång gratis

Visualiseringar: lmplot

Linjära modelldiagram hjälper oss att visualisera om variabler har ett samband med den beroende variabeln. Om de har det är de goda kandidater att ta med i analysen. Om de inte har det behöver vi inte nödvändigtvis utesluta dem – det kan istället betyda att vi behöver bearbeta eller transformera dem innan de kan användas.

seaborn finns tillgängligt i din arbetsyta med det vanliga aliaset sns.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Filtrera den inlästa datamängden df till kolumnerna 'SALESCLOSEPRICE' och 'LIVINGAREA' med select().
  • Ta ett urval på 50 % av dataramen med sample(), utan återläggning, och sätt slumpmiljöns startvärde till 42.
  • Konvertera Spark-dataramen till en pandas.DataFrame() med toPandas().
  • Plotta ett linjärt modelldiagram med seaborns lmplot(), där 'SALESCLOSEPRICE' är din beroende variabel och 'LIVINGAREA' är din oberoende variabel.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)

# Convert to pandas dataframe
pandas_df = sample_df.____()

# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()
Redigera och kör kod