ПочатиПочніть безкоштовно

Додавання поля ID

Під час роботи з даними інколи потрібно звертатися лише до окремих полів і виконувати різні операції. У цьому завданні знайдіть усі унікальні імена виборців у датафреймі та додайте унікальний номер ID. Пам'ятайте, що Spark призначає ID на основі розбивки (partition) датафрейма — тому значення ID можуть бути значно більшими за фактичну кількість рядків у датафреймі.

Через ледаче (lazy) опрацювання у Spark ідентифікатори фактично генеруються лише під час виконання дії (action) і можуть виглядати дещо випадковими залежно від розміру набору даних.

Сесія spark і датафрейм Spark df, що містить файл DallasCouncilVotes.csv.gz, доступні у вашому робочому середовищі. Бібліотека pyspark.sql.functions доступна під псевдонімом F.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Виберіть унікальні значення зі стовпця VOTER NAME і створіть новий датафрейм voter_df.
  • Порахуйте кількість рядків у датафреймі voter_df.
  • Додайте стовпець ROW_ID за допомогою відповідної функції Spark.
  • Відобразьте рядки з 10 найбільшими значеннями ROW_ID.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Select all the unique council voters
voter_df = df.____(df["VOTER NAME"]).____()

# Count the rows in voter_df
print("\nThere are %d rows in the voter_df DataFrame.\n" % ____)

# Add a ROW_ID
voter_df = voter_df.____('ROW_ID', F.____())

# Show the rows with 10 highest IDs in the set
voter_df.orderBy(voter_df.____.desc()).show(____)
Редагувати та запускати код