1. Learn
  2. /
  3. Курси
  4. /
  5. Очищення даних у PySpark

Connected

Вправа

Додавання поля ID

Під час роботи з даними інколи потрібно звертатися лише до окремих полів і виконувати різні операції. У цьому завданні знайдіть усі унікальні імена виборців у датафреймі та додайте унікальний номер ID. Пам'ятайте, що Spark призначає ID на основі розбивки (partition) датафрейма — тому значення ID можуть бути значно більшими за фактичну кількість рядків у датафреймі.

Через ледаче (lazy) опрацювання у Spark ідентифікатори фактично генеруються лише під час виконання дії (action) і можуть виглядати дещо випадковими залежно від розміру набору даних.

Сесія spark і датафрейм Spark df, що містить файл DallasCouncilVotes.csv.gz, доступні у вашому робочому середовищі. Бібліотека pyspark.sql.functions доступна під псевдонімом F.

Інструкції

100 XP
  • Виберіть унікальні значення зі стовпця VOTER NAME і створіть новий датафрейм voter_df.
  • Порахуйте кількість рядків у датафреймі voter_df.
  • Додайте стовпець ROW_ID за допомогою відповідної функції Spark.
  • Відобразьте рядки з 10 найбільшими значеннями ROW_ID.