Začněte nyníZačněte zdarma

Pivot & Join

Umět rozložit a pivotovat složené pole je skvělé, ale zůstaneš s dataframem obsahujícím pouze pivotované hodnoty. Aby to bylo skutečně užitečné, budeš je muset zpětně spojit s původním datasetem! Po spojení datasetů bude mít hodně NULL hodnot v nově vytvořených sloupcích – protože víme, jak vznikly, můžeme je bezpečně nahradit nulou: daný atribut buď existuje, nebo ne.

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Pivotuj hodnoty ex_garage_list tak, že je seskupíš podle identifikátoru záznamu NO pomocí groupBy() – k agregaci constant_val použij připravený kód, který ignoruje prázdné hodnoty a bere první dostupnou.
  • Připoj piv_df k df levým joinem s podmínkou NO.
  • Vytvoř seznam sloupců zfill_cols pro doplnění nul pomocí atributu columns na piv_df.
  • Doplň nuly do sloupců pivotovaného dataframu zfill_cols pomocí fillna() s parametrem subset.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from pyspark.sql.functions import coalesce, first

# Pivot 
piv_df = ex_df.____(____).____(____).agg(coalesce(first(____)))

# Join the dataframes together and fill null
joined_df = ____.join(____, on='NO', how=____)

# Columns to zero fill
zfill_cols = ____.____

# Zero fill the pivoted values
zfilled_df = joined_df.____(0, subset=____)
Upravit a spustit kód