開始使用免費開始

操作資料集

在許多情況下,你需要先對資料集做一些操作,才能在 ML 任務中使用。兩個常見的操作是篩選與選取(或切片)。由於這些資料集通常很大,Hugging Face 採用 Arrow 檔案型別。

這也代表操作方式會和你熟悉的有一點不同。所幸已經有現成的方法能幫上忙!

資料集已替你載入為 wikipedia

本練習屬於課程

善用 Hugging Face

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])

# Create a sample dataset
example = ____.____(range(1))

print(example[0]["text"])
編輯並執行程式碼