データセットの操作
機械学習タスクで使用する前に、データセットを加工・操作する必要があるケースがあります。よく使われる操作として、フィルタリングとセレクトやスライスと呼ばれるデータの切り抜きの2つが挙げられます。データセットのサイズが大きいため、Hugging FaceはArrowファイル形式を活用しています。
そのため、操作の方法が少し異なります。ただし、こうした操作が簡単にできる方法があるので安心してください。
データセットはすでにwikipediaとして読み込まれています。
この演習はコースの一部です
Hugging Faceを使いこなす
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])
# Create a sample dataset
example = ____.____(range(1))
print(example[0]["text"])