Вибірка та очищення датафрейму в PySpark
Після перевірки даних зазвичай потрібно їх очистити: зробити вибірку, перейменувати стовпці, прибрати дублікати рядків тощо. API DataFrame у PySpark надає для цього низку операторів. У цій вправі вам потрібно вибрати стовпці 'name', 'sex' і 'date of birth' з датафрейму people_df, видалити з нього дублікати рядків і порахувати кількість рядків до та після видалення дублікатів.
Пам'ятайте: у вашому середовищі вже доступні SparkSession spark і датафрейм people_df.
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Виберіть стовпці 'name', 'sex' і 'date of birth' з
people_dfі створіть датафреймpeople_df_sub. - Виведіть перші 10 спостережень у датафреймі
people_df_sub. - Видаліть дублікати з датафрейму
people_df_subі створітьpeople_df_sub_nodup. - Скільки рядків є до та після видалення дублікатів?
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)
# Print the first 10 observations from people_df_sub
people_df_sub.____(____)
# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()
# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))