spaCy로 텍스트 처리하기
모든 NLP 애플리케이션은 여러 텍스트 처리 단계로 구성돼요. 지금까지 토큰화, 표제어 추출(lematization), 문장 분할, 개체명 인식 등 몇 가지 단계를 이미 배웠습니다.
이번 연습에서는 spaCy로 텍스트를 문장 단위로 나누고 개체명을 추출하는 등 텍스트 처리 단계를 계속 연습해 볼게요. 데이터는 Amazon Fine Food Reviews의 앞선 5개 리뷰를 사용합니다. 이 리뷰들은 texts 객체로 접근할 수 있어요.
en_core_web_sm 모델은 이미 로드되어 있으며 nlp로 사용할 수 있습니다. 또한 texts의 각 항목에 해당하는 Doc 컨테이너 목록도 미리 로드되어 documents에서 접근할 수 있습니다.
이 연습은 강의의 일부입니다
spaCy로 배우는 자연어 처리
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]
# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)