Identyfikatory a różne partycje
Właśnie skończyłeś dodawać pole ID do obiektu DataFrame. Teraz sprawdź, co się dzieje, gdy zrobisz to samo na obiektach DataFrame zawierających różną liczbę partycji.
Aby sprawdzić liczbę partycji, użyj metody .rdd.getNumPartitions() na obiekcie DataFrame.
W twoim środowisku dostępna jest sesja spark oraz dwa obiekty DataFrame: voter_df i voter_df_single. Instrukcje pomogą ci odkryć różnicę między nimi. Biblioteka pyspark.sql.functions jest dostępna pod aliasem F.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Wyświetl liczbę partycji każdego obiektu DataFrame.
- Dodaj pole
ROW_IDdo każdego obiektu DataFrame. - Pokaż 10 pierwszych identyfikatorów z każdego obiektu DataFrame.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)
# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____
# Show the top 10 IDs in each DataFrame
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)