Dodawanie pola ID
Podczas pracy z danymi często potrzebujesz dostępu tylko do wybranych pól i wykonywania różnych operacji. W tym ćwiczeniu znajdź wszystkie unikalne nazwy wyborców w DataFrame i przypisz każdej z nich unikalny numer ID. Pamiętaj, że identyfikatory w Sparku są przydzielane na podstawie partycji DataFrame – dlatego wartości ID mogą być znacznie większe niż rzeczywista liczba wierszy.
Ze względu na leniwe przetwarzanie w Sparku, identyfikatory nie są faktycznie generowane aż do momentu wykonania akcji – ich wartości mogą być częściowo losowe, zależnie od rozmiaru zbioru danych.
W środowisku pracy dostępne są: sesja spark oraz DataFrame df zawierający plik DallasCouncilVotes.csv.gz. Biblioteka pyspark.sql.functions jest dostępna pod aliasem F.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Wybierz unikalne wpisy z kolumny
VOTER NAMEi utwórz nowy DataFrame o nazwievoter_df. - Zlicz wiersze w DataFrame
voter_df. - Dodaj kolumnę ROW_ID, korzystając z odpowiedniej funkcji Sparka.
- Wyświetl 10 wierszy z najwyższymi wartościami ROW_ID.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Select all the unique council voters
voter_df = df.____(df["VOTER NAME"]).____()
# Count the rows in voter_df
print("\nThere are %d rows in the voter_df DataFrame.\n" % ____)
# Add a ROW_ID
voter_df = voter_df.____('ROW_ID', F.____())
# Show the rows with 10 highest IDs in the set
voter_df.orderBy(voter_df.____.desc()).show(____)