НачатьНачать бесплатно

Работа с наборами данных

Перед использованием набора данных в задачах машинного обучения его нередко приходится предварительно обрабатывать. Два наиболее распространённых способа — фильтрация и выборка (или срез). Из-за большого объёма данных Hugging Face использует формат файлов Arrow.

Это означает, что способы обработки данных немного отличаются от привычных. К счастью, для этого уже есть готовые методы!

Набор данных уже загружен под именем wikipedia.

Это упражнение является частью курса

Работа с Hugging Face

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])

# Create a sample dataset
example = ____.____(range(1))

print(example[0]["text"])
Редактировать и запускать код