spaCy로 문장 분할하기
이번 연습에서는 문장 분할을 실습해 보겠습니다. NLP에서 문서(텍스트)를 문장 단위로 나누는 작업은 매우 유용한 기본 연산이에요. 예를 들어 개체명 인식처럼 더 복잡한 많은 NLP 작업의 첫 단계이기도 합니다. 또, 문장 수를 파악하면 텍스트가 제공하는 정보량에 대한 단서를 얻을 수도 있어요.
texts라는 리스트에 음식 리뷰 10개가 들어 있습니다.
en_core_web_sm 모델은 이미 nlp로 로드되어 있어요.
이 연습은 강의의 일부입니다
spaCy로 배우는 자연어 처리
연습 안내
texts리스트의 각 항목에spaCy모델을 실행해 모든Doc컨테이너로 이루어진 리스트documents를 만드세요.documents리스트를 순회하면서 각doc컨테이너의 문장을 추출해sentences라는 리스트에 추가하세요.sentences리스트를 사용해 각doc컨테이너의 문장 수를 세세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])