Začněte nyníZačněte zdarma

Výběr podmnožiny a čištění dat v PySpark DataFrame

Po prozkoumání dat je často potřeba data vyčistit – to zahrnuje výběr podmnožiny sloupců, přejmenování sloupců, odstranění duplicitních řádků a podobně. PySpark DataFrame API nabízí pro tyto úkoly řadu operátorů. V tomto cvičení tvým úkolem je vybrat sloupce 'name', 'sex' a 'date of birth' z DataFrame people_df, odstranit z nich duplicitní řádky a spočítat počet řádků před odstraněním duplicit i po něm.

Pamatuj, že v prostředí máš k dispozici SparkSession spark a DataFrame people_df.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Z DataFrame people_df vyber sloupce 'name', 'sex' a 'date of birth' a vytvoř DataFrame people_df_sub.
  • Vypiš prvních 10 záznamů z DataFrame people_df_sub.
  • Odstraň duplicitní záznamy z DataFrame people_df_sub a vytvoř DataFrame people_df_sub_nodup.
  • Kolik řádků obsahují data před odstraněním duplicit a kolik po něm?

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)

# Print the first 10 observations from people_df_sub
people_df_sub.____(____)

# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()

# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))
Upravit a spustit kód