Začněte nyníZačněte zdarma

Vizualizace pomocí distplot

Porozumění rozdělení závislé proměnné je velmi důležité a může ovlivnit výběr modelu i způsob předzpracování dat. Skvělý způsob, jak toho dosáhnout, je vizualizace – jenže vykreslování grafů není v PySparku vestavěná funkce, takže je potřeba provést několik mezikroků. V tomto cvičení vizualizuješ proměnnou 'LISTPRICE' a pomocí výpočtu šikmosti získáš hlubší přehled o jejím rozdělení.

Balíčky matplotlib.pyplot a seaborn jsou již naimportovány s aliasy plt a sns.

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Pomocí metody sample() vytvoř 50% vzorek dataframu df – bez nahrazování a s náhodným seedem nastaveným na 42.
  • Převeď Spark DataFrame na pandas.DataFrame() pomocí toPandas().
  • Vykresli distribuční graf metodou distplot() z balíčku seaborn.
  • Naimportuj funkci skewness() z pyspark.sql.functions a spočítej ji na agregaci sloupce 'LISTPRICE' pomocí metody agg(). Nezapomeň výsledek vyhodnotit zavoláním collect().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()

# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()

# Import skewness function
from pyspark.sql.functions import skewness

# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())
Upravit a spustit kód