Aan de slagBegin gratis

Visualisaties gebruiken: lmplot

Lineaire modelplots maken helpt je te visualiseren of variabelen samenhangen met de afhankelijke variabele. Als dat zo is, zijn ze goede kandidaten om in je analyse op te nemen. Als dat niet zo is, betekent dat niet dat je ze moet weggooien; het kan zijn dat je ze eerst moet bewerken of opschonen voordat je ze kunt gebruiken.

seaborn is beschikbaar in je werkruimte met de gebruikelijke alias sns.

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Gebruik de geladen gegevensset df en filter deze terug tot de kolommen 'SALESCLOSEPRICE' en 'LIVINGAREA' met select().
  • Neem een steekproef van 50% van de DataFrame met sample(), zorg dat je zonder terugleggen sampelt en stel de willekeurige seed in op 42.
  • Zet de Spark DataFrame om naar een pandas.DataFrame() met toPandas().
  • Gebruik 'SALESCLOSEPRICE' als afhankelijke variabele en 'LIVINGAREA' als onafhankelijke variabele en maak een lineair modelplot met seaborn lmplot().

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)

# Convert to pandas dataframe
pandas_df = sample_df.____()

# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()
Code bewerken en uitvoeren