Visualiseringar: lmplot
Linjära modelldiagram hjälper oss att visualisera om variabler har ett samband med den beroende variabeln. Om de har det är de goda kandidater att ta med i analysen. Om de inte har det behöver vi inte nödvändigtvis utesluta dem – det kan istället betyda att vi behöver bearbeta eller transformera dem innan de kan användas.
seaborn finns tillgängligt i din arbetsyta med det vanliga aliaset sns.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Filtrera den inlästa datamängden
dftill kolumnerna 'SALESCLOSEPRICE' och 'LIVINGAREA' medselect(). - Ta ett urval på 50 % av dataramen med
sample(), utan återläggning, och sätt slumpmiljöns startvärde till 42. - Konvertera Spark-dataramen till en
pandas.DataFrame()medtoPandas(). - Plotta ett linjärt modelldiagram med seaborns
lmplot(), där 'SALESCLOSEPRICE' är din beroende variabel och 'LIVINGAREA' är din oberoende variabel.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)
# Convert to pandas dataframe
pandas_df = sample_df.____()
# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()