Začněte nyníZačněte zdarma

Přidání pole s ID

Při práci s daty se občas hodí přistupovat jen k určitým polím a provádět různé operace. V tomto cvičení najdi všechna unikátní jména voličů z DataFrame a přidej jim jedinečné ID. Měj na paměti, že ID v Sparku se přiřazují na základě partition DataFrame – výsledné hodnoty ID tedy mohou být výrazně vyšší než skutečný počet řádků.

Díky líznému (lazy) zpracování v Sparku se ID negenerují, dokud není spuštěna akce, a mohou být do jisté míry náhodná v závislosti na velikosti datasetu.

V tvém pracovním prostředí je k dispozici session spark a Spark DataFrame df načtený ze souboru DallasCouncilVotes.csv.gz. Knihovna pyspark.sql.functions je dostupná pod aliasem F.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vyber unikátní záznamy ze sloupce VOTER NAME a ulož je do nového DataFrame s názvem voter_df.
  • Spočítej počet řádků v DataFrame voter_df.
  • Přidej sloupec ROW_ID pomocí příslušné funkce Sparku.
  • Zobraz 10 řádků s nejvyššími hodnotami ROW_ID.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Select all the unique council voters
voter_df = df.____(df["VOTER NAME"]).____()

# Count the rows in voter_df
print("\nThere are %d rows in the voter_df DataFrame.\n" % ____)

# Add a ROW_ID
voter_df = voter_df.____('ROW_ID', F.____())

# Show the rows with 10 highest IDs in the set
voter_df.orderBy(voter_df.____.desc()).show(____)
Upravit a spustit kód