Zacznij terazZacznij za darmo

Manipulowanie zbiorami danych

Bardzo często przed użyciem zbioru danych w zadaniu uczenia maszynowego trzeba go najpierw odpowiednio przetworzyć. Dwie najczęstsze operacje to filtrowanie i wybieranie (czyli wycinanie fragmentów). Ze względu na rozmiar zbiorów danych Hugging Face korzysta z formatu plików Arrow.

Oznacza to, że sposób wykonywania tych operacji nieco różni się od tego, do czego możesz być przyzwyczajony/przyzwyczajona. Na szczęście dostępne są już gotowe metody, które w tym pomagają!

Zbiór danych jest już wczytany jako wikipedia.

To ćwiczenie jest częścią kursu

Praca z Hugging Face

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])

# Create a sample dataset
example = ____.____(range(1))

print(example[0]["text"])
Edytuj i uruchom kod