시작하기무료로 시작하기

데이터셋 조작하기

ML 작업에 사용하기 전에 데이터셋을 조작해야 하는 경우가 자주 있습니다. 흔히 사용하는 두 가지 조작은 필터링과 선택(또는 슬라이싱)입니다. 이러한 데이터셋의 크기가 크기 때문에 Hugging Face는 Arrow 파일 형식을 사용합니다.

이는 조작 방법이 평소에 하던 방식과 조금 다를 수 있다는 뜻입니다. 다행히 이를 도와주는 메서드가 이미 준비되어 있어요!

데이터셋은 이미 wikipedia로 로드되어 있습니다.

이 연습은 강의의 일부입니다

Hugging Face 활용하기

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])

# Create a sample dataset
example = ____.____(range(1))

print(example[0]["text"])
코드 편집 및 실행