ПочатиПочніть безкоштовно

Вибірка та очищення датафрейму в PySpark

Після перевірки даних зазвичай потрібно їх очистити: зробити вибірку, перейменувати стовпці, прибрати дублікати рядків тощо. API DataFrame у PySpark надає для цього низку операторів. У цій вправі вам потрібно вибрати стовпці 'name', 'sex' і 'date of birth' з датафрейму people_df, видалити з нього дублікати рядків і порахувати кількість рядків до та після видалення дублікатів.

Пам'ятайте: у вашому середовищі вже доступні SparkSession spark і датафрейм people_df.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Виберіть стовпці 'name', 'sex' і 'date of birth' з people_df і створіть датафрейм people_df_sub.
  • Виведіть перші 10 спостережень у датафреймі people_df_sub.
  • Видаліть дублікати з датафрейму people_df_sub і створіть people_df_sub_nodup.
  • Скільки рядків є до та після видалення дублікатів?

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)

# Print the first 10 observations from people_df_sub
people_df_sub.____(____)

# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()

# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))
Редагувати та запускати код