创建 Categorical 列
回到这家流媒体初创公司的电影数据集。original_language 列中的大多数行只使用了少数几个代码(en、fr、es 等)。将其转换为 Categorical 后,每个唯一标签会在底层被编码为整数,从而在重复字符串上节省内存。
本练习是课程的一部分
使用 Polars 扩展与优化数据流水线
练习说明
- 将
original_language列转换为pl.Categorical。
交互式实操练习
通过完成这段示例代码来试试这个练习。
movies_cat = movies.with_columns(
# Cast to Categorical to save memory
pl.col("original_language").____(pl.____)
)
result = movies_cat.select("movie_title", "original_language").head(8)
print(result)