操作資料集
在許多情況下,你需要先對資料集做一些操作,才能在 ML 任務中使用。兩個常見的操作是篩選與選取(或切片)。由於這些資料集通常很大,Hugging Face 採用 Arrow 檔案型別。
這也代表操作方式會和你熟悉的有一點不同。所幸已經有現成的方法能幫上忙!
資料集已替你載入為 wikipedia。
本練習屬於課程
善用 Hugging Face
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])
# Create a sample dataset
example = ____.____(range(1))
print(example[0]["text"])