Visualiseringar: distplot
Att förstå fördelningen av vår beroende variabel är mycket viktigt och kan påverka valet av modell och förprocessning. Ett bra sätt att göra detta är att plotta variabeln, men plottning är inte en inbyggd funktion i PySpark – vi behöver ta några mellansteg för att det ska fungera korrekt. I den här övningen visualiserar du variabeln 'LISTPRICE' och får djupare insikter om dess fördelning genom att beräkna skevheten.
Paketen matplotlib.pyplot och seaborn har importerats åt dig med aliasen plt och sns.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Sampla 50 % av dataramen
dfmedsample(), se till att inte använda återläggning och sätt slumptalet till 42. - Konvertera Spark-dataramen till en
pandas.DataFrame()medtoPandas(). - Plotta ett fördelningsdiagram med
seaborns metoddistplot(). - Importera funktionen
skewness()frånpyspark.sql.functionsoch beräkna den på aggregatet av kolumnen'LISTPRICE'med metodenagg(). Kom ihåg att anropacollect()för att utvärdera beräkningen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()
# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()
# Import skewness function
from pyspark.sql.functions import skewness
# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())