НачатьНачать бесплатно

Чтение Dask DataFrames из Parquet

В главе 1 вы анализировали данные Spotify, разбитые на несколько файлов, чтобы найти топ-хиты 2005–2020 годов. Для этого вы использовали функцию dask.delayed() и цикл. Теперь посмотрим, насколько проще выполнить этот же анализ с помощью Dask DataFrames.

dask.dataframe уже импортирован как dd.

Это упражнение является частью курса

Параллельное программирование с Dask на Python

Посмотреть курс

Инструкции к упражнению

  • Загрузите папку с данными в формате Parquet, расположенную по пути "data/spotify_parquet".
  • Используйте метод .nlargest() объекта DataFrame, чтобы найти топ-10 песен по показателю 'popularity'.
  • Преобразуйте отложенный объект в pandas DataFrame, вычислив результат.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
Редактировать и запускать код