Додавання поля ID
Під час роботи з даними інколи потрібно звертатися лише до окремих полів і виконувати різні операції. У цьому завданні знайдіть усі унікальні імена виборців у датафреймі та додайте унікальний номер ID. Пам'ятайте, що Spark призначає ID на основі розбивки (partition) датафрейма — тому значення ID можуть бути значно більшими за фактичну кількість рядків у датафреймі.
Через ледаче (lazy) опрацювання у Spark ідентифікатори фактично генеруються лише під час виконання дії (action) і можуть виглядати дещо випадковими залежно від розміру набору даних.
Сесія spark і датафрейм Spark df, що містить файл DallasCouncilVotes.csv.gz, доступні у вашому робочому середовищі. Бібліотека pyspark.sql.functions доступна під псевдонімом F.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Виберіть унікальні значення зі стовпця
VOTER NAMEі створіть новий датафреймvoter_df. - Порахуйте кількість рядків у датафреймі
voter_df. - Додайте стовпець ROW_ID за допомогою відповідної функції Spark.
- Відобразьте рядки з 10 найбільшими значеннями ROW_ID.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Select all the unique council voters
voter_df = df.____(df["VOTER NAME"]).____()
# Count the rows in voter_df
print("\nThere are %d rows in the voter_df DataFrame.\n" % ____)
# Add a ROW_ID
voter_df = voter_df.____('ROW_ID', F.____())
# Show the rows with 10 highest IDs in the set
voter_df.orderBy(voter_df.____.desc()).show(____)