Utilizarea vizualizărilor: distplot
Înțelegerea distribuției variabilei noastre dependente este foarte importantă și poate influența tipul de model sau preprocesare pe care îl alegem. O modalitate excelentă de a face acest lucru este să o reprezentăm grafic – însă crearea de grafice nu este o funcție integrată în PySpark, așa că va trebui să parcurgem câțiva pași intermediari pentru ca totul să funcționeze corect. În acest exercițiu vei vizualiza variabila 'LISTPRICE' și vei obține mai multe informații despre distribuția ei calculând asimetria (skewness).
Pachetele matplotlib.pyplot și seaborn au fost deja importate cu aliasurile plt și sns.
Acest exercițiu face parte din cursul
Feature Engineering cu PySpark
Instrucțiuni pentru exercițiu
- Eșantionează 50% din dataframe-ul
dffolosindsample(), fără înlocuire și cu seed-ul aleatoriu setat la 42. - Convertește Spark DataFrame-ul într-un
pandas.DataFrame()cu ajutorul metodeitoPandas(). - Creează un grafic de distribuție folosind metoda
distplot()dinseaborn. - Importă funcția
skewness()dinpyspark.sql.functionsși calculează-o pe agregatul coloanei'LISTPRICE'cu metodaagg(). Nu uita să apelezicollect()pentru a evalua rezultatul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()
# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()
# Import skewness function
from pyspark.sql.functions import skewness
# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())