Зчитування Dask DataFrames з Parquet
У розділі 1 ви аналізували дані Spotify, розподілені між кількома файлами, щоб знайти топ-хіти 2005–2020 років. Ви робили це за допомогою функції dask.delayed() та циклу. Подивімося, наскільки простішим стане цей аналіз із Dask DataFrames.
dask.dataframe уже імпортовано як dd.
Ця вправа є частиною курсу
Паралельне програмування з Dask у Python
Інструкції до вправи
- Завантажте папку з даними Parquet, що розташована у
"data/spotify_parquet". - Використайте метод датафрейму
.nlargest(), щоб знайти топ 10 пісень за'popularity'. - Перетворіть відкладений об'єкт на датафрейм pandas, обчисливши його.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Read the spotify_parquet folder
df = ____
# Find the 10 most popular songs
top_10_songs = ____
# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____
print(top_10_songs_df)