Manipulowanie zbiorami danych
Bardzo często przed użyciem zbioru danych w zadaniu uczenia maszynowego trzeba go najpierw odpowiednio przetworzyć. Dwie najczęstsze operacje to filtrowanie i wybieranie (czyli wycinanie fragmentów). Ze względu na rozmiar zbiorów danych Hugging Face korzysta z formatu plików Arrow.
Oznacza to, że sposób wykonywania tych operacji nieco różni się od tego, do czego możesz być przyzwyczajony/przyzwyczajona. Na szczęście dostępne są już gotowe metody, które w tym pomagają!
Zbiór danych jest już wczytany jako wikipedia.
To ćwiczenie jest częścią kursu
Praca z Hugging Face
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])
# Create a sample dataset
example = ____.____(range(1))
print(example[0]["text"])