ID s různým počtem oddílů
Právě ses naučil/a přidávat pole s ID do DataFramu. Teď se podívej, co se stane, když to samé uděláš na DataFramech s různým počtem oddílů.
Počet oddílů zjistíš pomocí metody .rdd.getNumPartitions() zavolané na DataFrame.
V pracovním prostředí máš k dispozici session spark a dva DataFramy: voter_df a voter_df_single. Postupuj podle pokynů a zjisti, v čem se tyto DataFramy liší. Knihovna pyspark.sql.functions je dostupná pod aliasem F.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Vypiš počet oddílů každého DataFramu.
- Přidej do každého DataFramu pole
ROW_ID. - Zobraz prvních 10 ID z každého DataFramu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)
# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____
# Show the top 10 IDs in each DataFrame
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)