Visualisaties gebruiken: lmplot
Lineaire modelplots maken helpt je te visualiseren of variabelen samenhangen met de afhankelijke variabele. Als dat zo is, zijn ze goede kandidaten om in je analyse op te nemen. Als dat niet zo is, betekent dat niet dat je ze moet weggooien; het kan zijn dat je ze eerst moet bewerken of opschonen voordat je ze kunt gebruiken.
seaborn is beschikbaar in je werkruimte met de gebruikelijke alias sns.
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Gebruik de geladen gegevensset
dfen filter deze terug tot de kolommen 'SALESCLOSEPRICE' en 'LIVINGAREA' metselect(). - Neem een steekproef van 50% van de DataFrame met
sample(), zorg dat je zonder terugleggen sampelt en stel de willekeurige seed in op 42. - Zet de Spark DataFrame om naar een
pandas.DataFrame()mettoPandas(). - Gebruik 'SALESCLOSEPRICE' als afhankelijke variabele en 'LIVINGAREA' als onafhankelijke variabele en maak een lineair modelplot met seaborn
lmplot().
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)
# Convert to pandas dataframe
pandas_df = sample_df.____()
# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()