Визначення та фільтрація
Уявіть, що у вас є набір даних перепису населення з заголовком і схемою. Завантажмо цей набір і дозвольмо PySpark визначити схему автоматично. Що ви побачите, якщо відфільтруєте дорослих старших за 40 років?
Пам'ятайте: у вашому робочому середовищі вже є SparkSession під назвою spark!
Ця вправа є частиною курсу
Вступ до PySpark
Інструкції до вправи
- Завантажте JSON-файл
adults.json. - Відфільтруйте дані, щоб залишити дорослих зі значенням
ageпонад40. - Показати результати.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load the dataframe
census_df = spark.read.json("adults.json")
# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)
# Show the result
____