始める無料で始める

データセットの操作

機械学習タスクで使用する前に、データセットを加工・操作する必要があるケースがあります。よく使われる操作として、フィルタリングとセレクトやスライスと呼ばれるデータの切り抜きの2つが挙げられます。データセットのサイズが大きいため、Hugging FaceはArrowファイル形式を活用しています。

そのため、操作の方法が少し異なります。ただし、こうした操作が簡単にできる方法があるので安心してください。

データセットはすでにwikipediaとして読み込まれています。

この演習はコースの一部です

Hugging Faceを使いこなす

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])

# Create a sample dataset
example = ____.____(range(1))

print(example[0]["text"])
コードを編集して実行