시작하기무료로 시작하기

spaCy에서 파이프 추가하기

여러분은 다양한 NLP 작업에 기존 spaCy 모델을 자주 사용해요. 하지만 경우에 따라 문장 분할 같은 기성 파이프라인 컴포넌트가 기대한 결과를 내는 데 시간이 오래 걸릴 수 있어요. 이번 연습에서는 spaCy 모델(텍스트 처리 파이프라인)에 파이프라인 컴포넌트를 추가하는 방법을 연습해 보겠습니다.

이 연습에서는 Amazon Fine Food Reviews 데이터셋에서 처음 다섯 개 리뷰를 사용해요. texts 문자열을 통해 이 리뷰들에 접근할 수 있어요.

spaCy 패키지는 이미 임포트되어 있어 바로 사용할 수 있습니다.

이 연습은 강의의 일부입니다

spaCy로 배우는 자연어 처리

강의 보기

연습 안내

  • spaCy 영어 모델을 로드하고, 모델에 sentencizer 컴포넌트를 추가하세요.
  • texts에 대한 Doc 컨테이너를 만들고, 주어진 문서의 sentences를 저장할 리스트를 만든 다음 문장 개수를 출력하세요.
  • sentences 리스트에서 두 번째 문장의 토큰 리스트를 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
코드 편집 및 실행