Zacznij terazZacznij za darmo

Wczytywanie pliku CSV i wykonywanie agregacji

Masz arkusz kalkulacyjny z danymi o wynagrodzeniach Data Scientistów z firm różnej wielkości – od małych po duże. Chcesz sprawdzić, czy średnie wynagrodzenia różnią się znacząco w zależności od rozmiaru firmy.

Pamiętaj – w twoim środowisku pracy dostępna jest już sesja SparkSession o nazwie spark!

To ćwiczenie jest częścią kursu

Wprowadzenie do PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj plik CSV jako DataFrame i pozwól Sparkowi automatycznie wywnioskować schemat.
  • Zwróć liczbę wierszy w zbiorze danych.
  • Pogrupuj dane według kolumny company_size i oblicz średnie wynagrodzenie na podstawie kolumny salary_in_usd.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
Edytuj i uruchom kod