Přidání pole s ID
Při práci s daty se občas hodí přistupovat jen k určitým polím a provádět různé operace. V tomto cvičení najdi všechna unikátní jména voličů z DataFrame a přidej jim jedinečné ID. Měj na paměti, že ID v Sparku se přiřazují na základě partition DataFrame – výsledné hodnoty ID tedy mohou být výrazně vyšší než skutečný počet řádků.
Díky líznému (lazy) zpracování v Sparku se ID negenerují, dokud není spuštěna akce, a mohou být do jisté míry náhodná v závislosti na velikosti datasetu.
V tvém pracovním prostředí je k dispozici session spark a Spark DataFrame df načtený ze souboru DallasCouncilVotes.csv.gz. Knihovna pyspark.sql.functions je dostupná pod aliasem F.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Vyber unikátní záznamy ze sloupce
VOTER NAMEa ulož je do nového DataFrame s názvemvoter_df. - Spočítej počet řádků v DataFrame
voter_df. - Přidej sloupec ROW_ID pomocí příslušné funkce Sparku.
- Zobraz 10 řádků s nejvyššími hodnotami ROW_ID.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Select all the unique council voters
voter_df = df.____(df["VOTER NAME"]).____()
# Count the rows in voter_df
print("\nThere are %d rows in the voter_df DataFrame.\n" % ____)
# Add a ROW_ID
voter_df = voter_df.____('ROW_ID', F.____())
# Show the rows with 10 highest IDs in the set
voter_df.orderBy(voter_df.____.desc()).show(____)