데이터셋 조작하기
ML 작업에 사용하기 전에 데이터셋을 조작해야 하는 경우가 자주 있습니다. 흔히 사용하는 두 가지 조작은 필터링과 선택(또는 슬라이싱)입니다. 이러한 데이터셋의 크기가 크기 때문에 Hugging Face는 Arrow 파일 형식을 사용합니다.
이는 조작 방법이 평소에 하던 방식과 조금 다를 수 있다는 뜻입니다. 다행히 이를 도와주는 메서드가 이미 준비되어 있어요!
데이터셋은 이미 wikipedia로 로드되어 있습니다.
이 연습은 강의의 일부입니다
Hugging Face 활용하기
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])
# Create a sample dataset
example = ____.____(range(1))
print(example[0]["text"])