Wizualizacja danych w PySpark DataFrame
Graficzne przedstawianie danych – czyli ich wizualizacja – jest niezbędne zarówno do zrozumienia, jak i interpretacji danych. W tym ćwiczeniu najpierw wyświetlisz nazwy kolumn DataFrame'a names_df, który już wcześniej utworzyłeś, a następnie przekonwertujesz names_df na DataFrame Pandas i na koniec wyrenderujesz dane jako poziomy wykres słupkowy – z imionami osób na osi x i ich wiekiem na osi y.
Pamiętaj, że w środowisku pracy masz już dostępne: SparkSession spark oraz DataFrame names_df.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Wyświetl nazwy kolumn DataFrame'a
names_df. - Przekonwertuj DataFrame
names_dfna DataFrame Pandas o nazwiedf_pandas. - Użyj metody
plot()z biblioteki matplotlib, aby utworzyć poziomy wykres słupkowy z kolumną'Name'na osi x i kolumną'Age'na osi y.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Check the column names of names_df
print("The column names of names_df are", names_df.____)
# Convert to Pandas DataFrame
df_pandas = names_df.____()
# Create a horizontal bar plot
____.plot(kind='barh', x='____', y='____', colormap='winter_r')
plt.show()