Część 3: Wizualizacja danych
Wizualizacja danych odgrywa kluczową rolę w eksploracyjnej analizie danych (EDA). Ramki danych PySpark są doskonałym punktem wyjścia do wizualizacji – dzięki wbudowanej strukturze i schematowi sprawdzają się w tym zadaniu znacznie lepiej niż RDD.
W tej trzeciej części stworzysz histogram wieku wszystkich piłkarzy z Niemiec, korzystając z ramki danych utworzonej w poprzednim ćwiczeniu. W tym celu najpierw przekonwertujesz ramkę danych PySpark na ramkę danych Pandas, a następnie użyjesz funkcji plot() z biblioteki matplotlib, aby wygenerować wykres gęstości wieku wszystkich graczy z Niemiec.
Pamiętaj, że w przestrzeni roboczej masz już dostępne: sesję SparkSession spark, tabelę tymczasową fifa_df_table oraz ramkę danych fifa_df_germany_age.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Przekonwertuj
fifa_df_germany_agena ramkę danych Pandas o nazwiefifa_df_germany_age_pandas. - Wygeneruj wykres gęstości kolumny 'Age' z ramki danych Pandas
fifa_df_germany_age_pandas.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()
# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()