Zacznij terazZacznij za darmo

Pobieranie danych z RDD

W tym ćwiczeniu będziesz pracować zarówno z RDD, jak i DataFrames w PySpark. Celem jest grupowanie danych i wykonywanie agregacji przy użyciu operacji na RDD oraz metod DataFrame.

Wczytasz plik CSV z danymi o wynagrodzeniach pracowników do PySpark jako RDD. Następnie pogrupujesz dane według poziomu doświadczenia i obliczysz maksymalne wynagrodzenie dla każdego poziomu na podstawie DataFrame. Dzięki temu zobaczysz, jakie są względne zalety obu formatów danych.

Zbiór danych dotyczy wynagrodzeń Data Scientist – śledzenie trendów rynkowych może okazać się bardzo przydatne! Dane zostały już za ciebie wczytane i znormalizowane. Pamiętaj, że w twoim obszarze roboczym istnieje już SparkSession o nazwie spark!

To ćwiczenie jest częścią kursu

Wprowadzenie do PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz RDD z DataFrame.
  • Pobierz i wyświetl wyniki RDD oraz DataFrame.
  • Pogrupuj dane według "experience_level" i oblicz maksymalne wynagrodzenie dla każdego poziomu.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____

# Collect and print the results
print(rdd_salaries.____)

# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})

# Show the results
dataframe_results.____
Edytuj i uruchom kod