ÎncepețiÎncepe gratuit

Utilizarea vizualizărilor: distplot

Înțelegerea distribuției variabilei noastre dependente este foarte importantă și poate influența tipul de model sau preprocesare pe care îl alegem. O modalitate excelentă de a face acest lucru este să o reprezentăm grafic – însă crearea de grafice nu este o funcție integrată în PySpark, așa că va trebui să parcurgem câțiva pași intermediari pentru ca totul să funcționeze corect. În acest exercițiu vei vizualiza variabila 'LISTPRICE' și vei obține mai multe informații despre distribuția ei calculând asimetria (skewness).

Pachetele matplotlib.pyplot și seaborn au fost deja importate cu aliasurile plt și sns.

Acest exercițiu face parte din cursul

Feature Engineering cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Eșantionează 50% din dataframe-ul df folosind sample(), fără înlocuire și cu seed-ul aleatoriu setat la 42.
  • Convertește Spark DataFrame-ul într-un pandas.DataFrame() cu ajutorul metodei toPandas().
  • Creează un grafic de distribuție folosind metoda distplot() din seaborn.
  • Importă funcția skewness() din pyspark.sql.functions și calculează-o pe agregatul coloanei 'LISTPRICE' cu metoda agg(). Nu uita să apelezi collect() pentru a evalua rezultatul.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()

# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()

# Import skewness function
from pyspark.sql.functions import skewness

# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())
Editează și rulează codul