Wizualizacje: distplot
Zrozumienie rozkładu zmiennej zależnej jest bardzo ważne – może wpłynąć na wybór modelu oraz na sposób przetwarzania danych. Świetnym sposobem na to jest wizualizacja, jednak PySpark nie ma wbudowanej funkcji do rysowania wykresów, więc potrzebnych jest kilka kroków pośrednich. W tym ćwiczeniu zwizualizujesz zmienną 'LISTPRICE' i lepiej poznasz jej rozkład, obliczając skośność.
Pakiety matplotlib.pyplot i seaborn zostały już zaimportowane z aliasami plt i sns.
To ćwiczenie jest częścią kursu
Inżynieria cech z PySpark
Instrukcje do ćwiczenia
- Pobierz próbkę 50% ramki danych
dfza pomocąsample()– bez zastępowania i z ziarnem losowości ustawionym na 42. - Przekształć Spark DataFrame do
pandas.DataFrame()za pomocątoPandas(). - Narysuj wykres rozkładu, używając metody
distplot()z bibliotekiseaborn. - Zaimportuj funkcję
skewness()zpyspark.sql.functionsi oblicz ją na agregacie kolumny'LISTPRICE'za pomocą metodyagg(). Pamiętaj, aby wywołaćcollect()na wyniku, żeby zainicjować obliczenia.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()
# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()
# Import skewness function
from pyspark.sql.functions import skewness
# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())