Работа с наборами данных
Перед использованием набора данных в задачах машинного обучения его нередко приходится предварительно обрабатывать. Два наиболее распространённых способа — фильтрация и выборка (или срез). Из-за большого объёма данных Hugging Face использует формат файлов Arrow.
Это означает, что способы обработки данных немного отличаются от привычных. К счастью, для этого уже есть готовые методы!
Набор данных уже загружен под именем wikipedia.
Это упражнение является частью курса
Работа с Hugging Face
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])
# Create a sample dataset
example = ____.____(range(1))
print(example[0]["text"])