Zacznij terazZacznij za darmo

Wnioskowanie schematu i filtrowanie

Wyobraź sobie, że masz zbiór danych ze spisu ludności – wiesz, że zawiera nagłówek i schemat. Załadujmy ten zbiór i pozwólmy PySpark samodzielnie wywnioskować schemat. Co zobaczysz po przefiltrowaniu dorosłych powyżej 40. roku życia?

Pamiętaj, że w twoim środowisku pracy jest już dostępna sesja SparkSession o nazwie spark!

To ćwiczenie jest częścią kursu

Wprowadzenie do PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Załaduj plik JSON adults.json.
  • Przefiltruj dane, aby uwzględnić dorosłych powyżej 40. roku życia (kolumna age).
  • Wyświetl wyniki.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the dataframe
census_df = spark.read.json("adults.json")

# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)

# Show the result
____
Edytuj i uruchom kod