Inference a filtrování
Představ si, že máš census dataset s hlavičkou a schématem. Pojďme ho načíst a nechat PySpark, ať schéma odvodí sám. Co uvidíš, když vyfiltrujeme dospělé starší 40 let?
Nezapomeň, že v tvém pracovním prostředí už máš k dispozici SparkSession s názvem spark!
Toto cvičení je součástí kurzu
Introduction to PySpark
Pokyny k cvičení
- Načti JSON soubor
adults.json. - Vyfiltruj data tak, aby zahrnovala pouze dospělé starší
40let (sloupecage). - Zobraz výsledky.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the dataframe
census_df = spark.read.json("adults.json")
# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)
# Show the result
____