Inferență și filtrare
Imaginez-ți că ai un set de date de tip recensământ, care include un antet și o schemă. Hai să îl încărcăm și să lăsăm PySpark să infereze schema. Ce observi dacă filtrezi adulții cu vârsta peste 40 de ani?
Reține că în spațiul tău de lucru există deja o SparkSession numită spark!
Acest exercițiu face parte din cursul
Introducere în PySpark
Instrucțiuni pentru exercițiu
- Încarcă fișierul JSON
adults.json. - Filtrează datele pentru a include adulții cu
agepeste40. - Afișează rezultatele.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the dataframe
census_df = spark.read.json("adults.json")
# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)
# Show the result
____