ÎncepețiÎncepe gratuit

Inferență și filtrare

Imaginez-ți că ai un set de date de tip recensământ, care include un antet și o schemă. Hai să îl încărcăm și să lăsăm PySpark să infereze schema. Ce observi dacă filtrezi adulții cu vârsta peste 40 de ani?

Reține că în spațiul tău de lucru există deja o SparkSession numită spark!

Acest exercițiu face parte din cursul

Introducere în PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă fișierul JSON adults.json.
  • Filtrează datele pentru a include adulții cu age peste 40.
  • Afișează rezultatele.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the dataframe
census_df = spark.read.json("adults.json")

# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)

# Show the result
____
Editează și rulează codul