开始使用免费开始使用

操作数据集

在进行机器学习任务之前,您很可能需要多次对数据集进行预处理。两种常见操作是过滤和选择(或切片)。考虑到这些数据集的体量,Hugging Face 使用的是 Arrow 文件类型。

这意味着操作方式会与您习惯的略有不同。好在已经有相应的方法可以直接使用!

数据集已为您加载在 wikipedia 中。

本练习是课程的一部分

使用 Hugging Face

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])

# Create a sample dataset
example = ____.____(range(1))

print(example[0]["text"])
编辑并运行代码