Začněte nyníZačněte zdarma

Práce s RDD pomocí collect()

V tomto cvičení budeš pracovat s RDD i DataFrames v PySparku. Cílem je seskupit data a provést agregaci pomocí operací s RDD i metod DataFrames.

Načteš CSV soubor s daty o platech zaměstnanců do PySparku jako RDD. Poté seskupíš data podle úrovně zkušeností a vypočítáš maximální plat pro každou úroveň z DataFramu. Díky tomu uvidíš, v čem každý z těchto formátů vyniká.

Dataset obsahuje data o platech datových vědců – sledování trendů na trhu práce se ti může hodit! Data jsme za tebe už načetli a normalizovali. Nezapomeň, že v tvém workspace je k dispozici SparkSession pojmenovaná spark!

Toto cvičení je součástí kurzu

Introduction to PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř RDD z DataFramu.
  • Načti a zobraz výsledky z RDD i DataFramu.
  • Seskup data podle "experience_level" a vypočítej maximální plat pro každou úroveň.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____

# Collect and print the results
print(rdd_salaries.____)

# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})

# Show the results
dataframe_results.____
Upravit a spustit kód