操作数据集
在进行机器学习任务之前,您很可能需要多次对数据集进行预处理。两种常见操作是过滤和选择(或切片)。考虑到这些数据集的体量,Hugging Face 使用的是 Arrow 文件类型。
这意味着操作方式会与您习惯的略有不同。好在已经有相应的方法可以直接使用!
数据集已为您加载在 wikipedia 中。
本练习是课程的一部分
使用 Hugging Face
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])
# Create a sample dataset
example = ____.____(range(1))
print(example[0]["text"])