Začněte nyníZačněte zdarma

Načtení CSV souboru a provádění agregací

Máš k dispozici tabulku platů datových vědců ze společností různých velikostí – od malých po velké. Chceš zjistit, zda existuje výrazný rozdíl mezi průměrnými platy v závislosti na velikosti firmy.

Nezapomeň, že v tvém pracovním prostředí je už připravená SparkSession s názvem spark!

Toto cvičení je součástí kurzu

Introduction to PySpark

Zobrazit kurz

Pokyny k cvičení

  • Načti CSV soubor jako DataFrame a nech Spark automaticky odvodit schéma.
  • Vrať počet řádků v DataFrame.
  • Seskup data podle sloupce company_size a vypočítej průměrný plat ze sloupce salary_in_usd.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
Upravit a spustit kód