Zacznij terazZacznij za darmo

Dodawanie pola ID

Podczas pracy z danymi często potrzebujesz dostępu tylko do wybranych pól i wykonywania różnych operacji. W tym ćwiczeniu znajdź wszystkie unikalne nazwy wyborców w DataFrame i przypisz każdej z nich unikalny numer ID. Pamiętaj, że identyfikatory w Sparku są przydzielane na podstawie partycji DataFrame – dlatego wartości ID mogą być znacznie większe niż rzeczywista liczba wierszy.

Ze względu na leniwe przetwarzanie w Sparku, identyfikatory nie są faktycznie generowane aż do momentu wykonania akcji – ich wartości mogą być częściowo losowe, zależnie od rozmiaru zbioru danych.

W środowisku pracy dostępne są: sesja spark oraz DataFrame df zawierający plik DallasCouncilVotes.csv.gz. Biblioteka pyspark.sql.functions jest dostępna pod aliasem F.

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wybierz unikalne wpisy z kolumny VOTER NAME i utwórz nowy DataFrame o nazwie voter_df.
  • Zlicz wiersze w DataFrame voter_df.
  • Dodaj kolumnę ROW_ID, korzystając z odpowiedniej funkcji Sparka.
  • Wyświetl 10 wierszy z najwyższymi wartościami ROW_ID.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Select all the unique council voters
voter_df = df.____(df["VOTER NAME"]).____()

# Count the rows in voter_df
print("\nThere are %d rows in the voter_df DataFrame.\n" % ____)

# Add a ROW_ID
voter_df = voter_df.____('ROW_ID', F.____())

# Show the rows with 10 highest IDs in the set
voter_df.orderBy(voter_df.____.desc()).show(____)
Edytuj i uruchom kod