Wczytywanie Dask DataFrames z plików Parquet
W rozdziale 1. analizowałeś dane Spotify podzielone na wiele plików, aby znaleźć największe hity z lat 2005–2020. Do tego celu użyłeś funkcji dask.delayed() i pętli. Teraz sprawdź, o ile prostsze staje się to zadanie dzięki Dask DataFrames.
dask.dataframe jest już zaimportowany jako dd.
To ćwiczenie jest częścią kursu
Programowanie równoległe z Dask w Pythonie
Instrukcje do ćwiczenia
- Wczytaj folder z danymi Parquet znajdującymi się pod ścieżką
"data/spotify_parquet". - Użyj metody
.nlargest()na DataFrame, aby znaleźć 10 piosenek z najwyższą wartością kolumny'popularity'. - Przekształć opóźniony obiekt w pandas DataFrame, wywołując jego obliczenie.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Read the spotify_parquet folder
df = ____
# Find the 10 most popular songs
top_10_songs = ____
# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____
print(top_10_songs_df)