Začněte nyníZačněte zdarma

Manipulace s datasetem

Před použitím datasetu v ML úloze ho budeš často potřebovat nejprve upravit. Dvě běžné operace jsou filtrování a výběr (tzv. slicing). Kvůli velikosti datasetů využívá Hugging Face formát arrow.

To znamená, že manipulace probíhají trochu jinak, než na co jsi možná zvyklý/á. Naštěstí už na to existují hotové metody!

Dataset je pro tebe načtený pod proměnnou wikipedia.

Toto cvičení je součástí kurzu

Working with Hugging Face

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])

# Create a sample dataset
example = ____.____(range(1))

print(example[0]["text"])
Upravit a spustit kód