Manipulace s datasetem
Před použitím datasetu v ML úloze ho budeš často potřebovat nejprve upravit. Dvě běžné operace jsou filtrování a výběr (tzv. slicing). Kvůli velikosti datasetů využívá Hugging Face formát arrow.
To znamená, že manipulace probíhají trochu jinak, než na co jsi možná zvyklý/á. Naštěstí už na to existují hotové metody!
Dataset je pro tebe načtený pod proměnnou wikipedia.
Toto cvičení je součástí kurzu
Working with Hugging Face
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])
# Create a sample dataset
example = ____.____(range(1))
print(example[0]["text"])