开始使用免费开始使用

从 Parquet 读取 Dask DataFrame

在第 1 章中,您分析了按多个文件拆分的 Spotify 数据,以找出 2005-2020 年的热门歌曲。当时您使用了 dask.delayed() 函数和循环。现在让我们看看,使用 Dask DataFrame 之后,这个分析会变得多么简单。

dask.dataframe 已为您导入为 dd

本练习是课程的一部分

Python 中的 Dask 并行编程

查看课程

练习说明

  • 加载位于 "data/spotify_parquet" 的 Parquet 数据文件夹。
  • 使用 DataFrame 的 .nlargest() 方法,按 'popularity' 找出前 10 首歌曲。
  • 通过计算将延迟对象转换为 pandas DataFrame。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
编辑并运行代码