Чтение Dask DataFrames из Parquet
В главе 1 вы анализировали данные Spotify, разбитые на несколько файлов, чтобы найти топ-хиты 2005–2020 годов. Для этого вы использовали функцию dask.delayed() и цикл. Теперь посмотрим, насколько проще выполнить этот же анализ с помощью Dask DataFrames.
dask.dataframe уже импортирован как dd.
Это упражнение является частью курса
Параллельное программирование с Dask на Python
Инструкции к упражнению
- Загрузите папку с данными в формате Parquet, расположенную по пути
"data/spotify_parquet". - Используйте метод
.nlargest()объекта DataFrame, чтобы найти топ-10 песен по показателю'popularity'. - Преобразуйте отложенный объект в pandas DataFrame, вычислив результат.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Read the spotify_parquet folder
df = ____
# Find the 10 most popular songs
top_10_songs = ____
# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____
print(top_10_songs_df)