Wnioskowanie schematu i filtrowanie
Wyobraź sobie, że masz zbiór danych ze spisu ludności – wiesz, że zawiera nagłówek i schemat. Załadujmy ten zbiór i pozwólmy PySpark samodzielnie wywnioskować schemat. Co zobaczysz po przefiltrowaniu dorosłych powyżej 40. roku życia?
Pamiętaj, że w twoim środowisku pracy jest już dostępna sesja SparkSession o nazwie spark!
To ćwiczenie jest częścią kursu
Wprowadzenie do PySpark
Instrukcje do ćwiczenia
- Załaduj plik JSON
adults.json. - Przefiltruj dane, aby uwzględnić dorosłych powyżej
40. roku życia (kolumnaage). - Wyświetl wyniki.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the dataframe
census_df = spark.read.json("adults.json")
# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)
# Show the result
____