统计流派热度
为了找出整个目录中最常见的流派,请重塑 genres 列表列,使每个流派各占一行,然后计算排序后的频数,查看哪些流派位居前列。
movies DataFrame 已为您预加载。
本练习是课程的一部分
使用 Polars 扩展与优化数据流水线
练习说明
- 对
genres列表列执行 explode,使每个流派各占一行。 - 使用排序后的频数统计,计算出现次数最多的前 10 个流派。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Put each genre on its own row
genres = movies.select("genres").____("genres")["genres"]
# Rank by frequency
result = genres.drop_nulls().____(sort=True).head(10)
print(result)