ПочатиПочніть безкоштовно

Фільтрування вашого датафрейму

У попередній вправі ви вибирали підмножину даних за допомогою оператора select(), який здебільшого використовують для вибірки стовпців датафрейму. А що робити, якщо потрібно вибрати підмножину датафрейму за умовою (наприклад, вибрати всі рядки, де стать — Female)? У цій вправі ви відфільтруєте рядки в датафреймі people_df, у яких 'sex' має значення female та male, і створите два окремі набори даних. На завершення ви порахуєте кількість рядків у кожному з цих наборів.

Пам'ятайте, у вашому середовищі вже доступні SparkSession spark і датафрейм people_df.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Відфільтруйте датафрейм people_df, щоб вибрати всі рядки, де стать — female, у датафрейм people_df_female.
  • Відфільтруйте датафрейм people_df, щоб вибрати всі рядки, де стать — male, у датафрейм people_df_male.
  • Порахуйте кількість рядків у датафреймах people_df_female та people_df_male.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Filter people_df to select females 
people_df_female = people_df.____(people_df.____ == "female")

# Filter people_df to select males
people_df_male = people_df.____(____ == "____")

# Count the number of rows 
print("There are {} rows in the people_df_female DataFrame and {} rows in the people_df_male DataFrame".format(people_df_female.____(), people_df_male.____()))
Редагувати та запускати код