Zacznij terazZacznij za darmo

Wizualizacja danych w PySpark DataFrame

Graficzne przedstawianie danych – czyli ich wizualizacja – jest niezbędne zarówno do zrozumienia, jak i interpretacji danych. W tym ćwiczeniu najpierw wyświetlisz nazwy kolumn DataFrame'a names_df, który już wcześniej utworzyłeś, a następnie przekonwertujesz names_df na DataFrame Pandas i na koniec wyrenderujesz dane jako poziomy wykres słupkowy – z imionami osób na osi x i ich wiekiem na osi y.

Pamiętaj, że w środowisku pracy masz już dostępne: SparkSession spark oraz DataFrame names_df.

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyświetl nazwy kolumn DataFrame'a names_df.
  • Przekonwertuj DataFrame names_df na DataFrame Pandas o nazwie df_pandas.
  • Użyj metody plot() z biblioteki matplotlib, aby utworzyć poziomy wykres słupkowy z kolumną 'Name' na osi x i kolumną 'Age' na osi y.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Check the column names of names_df
print("The column names of names_df are", names_df.____)

# Convert to Pandas DataFrame  
df_pandas = names_df.____()

# Create a horizontal bar plot
____.plot(kind='barh', x='____', y='____', colormap='winter_r')
plt.show()
Edytuj i uruchom kod