Kom igångKom igång gratis

Visualiseringar: distplot

Att förstå fördelningen av vår beroende variabel är mycket viktigt och kan påverka valet av modell och förprocessning. Ett bra sätt att göra detta är att plotta variabeln, men plottning är inte en inbyggd funktion i PySpark – vi behöver ta några mellansteg för att det ska fungera korrekt. I den här övningen visualiserar du variabeln 'LISTPRICE' och får djupare insikter om dess fördelning genom att beräkna skevheten.

Paketen matplotlib.pyplot och seaborn har importerats åt dig med aliasen plt och sns.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Sampla 50 % av dataramen df med sample(), se till att inte använda återläggning och sätt slumptalet till 42.
  • Konvertera Spark-dataramen till en pandas.DataFrame() med toPandas().
  • Plotta ett fördelningsdiagram med seaborns metod distplot().
  • Importera funktionen skewness() från pyspark.sql.functions och beräkna den på aggregatet av kolumnen 'LISTPRICE' med metoden agg(). Kom ihåg att anropa collect() för att utvärdera beräkningen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()

# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()

# Import skewness function
from pyspark.sql.functions import skewness

# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())
Redigera och kör kod