НачатьНачать бесплатно

Подмножества и очистка данных в PySpark DataFrame

После анализа данных нередко требуется их очистка: выбор нужных столбцов, переименование, удаление дублирующихся строк и т. д. API PySpark DataFrame предоставляет для этого несколько удобных операторов. В этом упражнении вам нужно выбрать столбцы «name», «sex» и «date of birth» из DataFrame people_df, удалить все дублирующиеся строки и сравнить количество строк до и после их удаления.

Напомним, что в вашем рабочем пространстве уже доступны SparkSession spark и DataFrame people_df.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Выберите столбцы «name», «sex» и «date of birth» из people_df и создайте DataFrame people_df_sub.
  • Выведите первые 10 строк DataFrame people_df_sub.
  • Удалите дублирующиеся записи из DataFrame people_df_sub и создайте DataFrame people_df_sub_nodup.
  • Сколько строк содержится в данных до и после удаления дубликатов?

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)

# Print the first 10 observations from people_df_sub
people_df_sub.____(____)

# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()

# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))
Редактировать и запускать код