ПочатиПочніть безкоштовно

Зчитування Dask DataFrames з Parquet

У розділі 1 ви аналізували дані Spotify, розподілені між кількома файлами, щоб знайти топ-хіти 2005–2020 років. Ви робили це за допомогою функції dask.delayed() та циклу. Подивімося, наскільки простішим стане цей аналіз із Dask DataFrames.

dask.dataframe уже імпортовано як dd.

Ця вправа є частиною курсу

Паралельне програмування з Dask у Python

Переглянути курс

Інструкції до вправи

  • Завантажте папку з даними Parquet, що розташована у "data/spotify_parquet".
  • Використайте метод датафрейму .nlargest(), щоб знайти топ 10 пісень за 'popularity'.
  • Перетворіть відкладений об'єкт на датафрейм pandas, обчисливши його.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
Редагувати та запускати код