Vizualizace pomocí distplot
Porozumění rozdělení závislé proměnné je velmi důležité a může ovlivnit výběr modelu i způsob předzpracování dat. Skvělý způsob, jak toho dosáhnout, je vizualizace – jenže vykreslování grafů není v PySparku vestavěná funkce, takže je potřeba provést několik mezikroků. V tomto cvičení vizualizuješ proměnnou 'LISTPRICE' a pomocí výpočtu šikmosti získáš hlubší přehled o jejím rozdělení.
Balíčky matplotlib.pyplot a seaborn jsou již naimportovány s aliasy plt a sns.
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Pomocí metody
sample()vytvoř 50% vzorek dataframudf– bez nahrazování a s náhodným seedem nastaveným na 42. - Převeď Spark DataFrame na
pandas.DataFrame()pomocítoPandas(). - Vykresli distribuční graf metodou
distplot()z balíčkuseaborn. - Naimportuj funkci
skewness()zpyspark.sql.functionsa spočítej ji na agregaci sloupce'LISTPRICE'pomocí metodyagg(). Nezapomeň výsledek vyhodnotit zavolánímcollect().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()
# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()
# Import skewness function
from pyspark.sql.functions import skewness
# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())