ПочатиПочніть безкоштовно

Опрацювання наборів даних

Часто перед використанням набору даних у задачі ML його потрібно попередньо опрацювати. Дві типові операції — це фільтрування та вибір (або зріз). З огляду на розміри таких наборів даних, Hugging Face використовує формат файлів Arrow.

Тому виконання таких операцій трохи відрізняється від звичного підходу. На щастя, для цього вже є зручні методи!

Набір даних уже завантажено для вас у змінну wikipedia.

Ця вправа є частиною курсу

Робота з Hugging Face

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])

# Create a sample dataset
example = ____.____(range(1))

print(example[0]["text"])
Редагувати та запускати код