Zacznij terazZacznij za darmo

Wizualizacje: distplot

Zrozumienie rozkładu zmiennej zależnej jest bardzo ważne – może wpłynąć na wybór modelu oraz na sposób przetwarzania danych. Świetnym sposobem na to jest wizualizacja, jednak PySpark nie ma wbudowanej funkcji do rysowania wykresów, więc potrzebnych jest kilka kroków pośrednich. W tym ćwiczeniu zwizualizujesz zmienną 'LISTPRICE' i lepiej poznasz jej rozkład, obliczając skośność.

Pakiety matplotlib.pyplot i seaborn zostały już zaimportowane z aliasami plt i sns.

To ćwiczenie jest częścią kursu

Inżynieria cech z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Pobierz próbkę 50% ramki danych df za pomocą sample() – bez zastępowania i z ziarnem losowości ustawionym na 42.
  • Przekształć Spark DataFrame do pandas.DataFrame() za pomocą toPandas().
  • Narysuj wykres rozkładu, używając metody distplot() z biblioteki seaborn.
  • Zaimportuj funkcję skewness() z pyspark.sql.functions i oblicz ją na agregacie kolumny 'LISTPRICE' za pomocą metody agg(). Pamiętaj, aby wywołać collect() na wyniku, żeby zainicjować obliczenia.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()

# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()

# Import skewness function
from pyspark.sql.functions import skewness

# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())
Edytuj i uruchom kod