Zacznij terazZacznij za darmo

Część 3: Wizualizacja danych

Wizualizacja danych odgrywa kluczową rolę w eksploracyjnej analizie danych (EDA). Ramki danych PySpark są doskonałym punktem wyjścia do wizualizacji – dzięki wbudowanej strukturze i schematowi sprawdzają się w tym zadaniu znacznie lepiej niż RDD.

W tej trzeciej części stworzysz histogram wieku wszystkich piłkarzy z Niemiec, korzystając z ramki danych utworzonej w poprzednim ćwiczeniu. W tym celu najpierw przekonwertujesz ramkę danych PySpark na ramkę danych Pandas, a następnie użyjesz funkcji plot() z biblioteki matplotlib, aby wygenerować wykres gęstości wieku wszystkich graczy z Niemiec.

Pamiętaj, że w przestrzeni roboczej masz już dostępne: sesję SparkSession spark, tabelę tymczasową fifa_df_table oraz ramkę danych fifa_df_germany_age.

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Przekonwertuj fifa_df_germany_age na ramkę danych Pandas o nazwie fifa_df_germany_age_pandas.
  • Wygeneruj wykres gęstości kolumny 'Age' z ramki danych Pandas fifa_df_germany_age_pandas.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()

# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()
Edytuj i uruchom kod