spaCy로 표제어 추출(Lemmatization)
이번 연습에서는 표제어 추출(lemmatization)을 실습해 볼 거예요. 표제어 추출은 파생된 단어에서 어근 형태를 얻는 데 유용해요. 즉, 어떤 문장이 주어지면 표제어의 개수는 토큰 개수보다 적거나 같을 것으로 기대할 수 있어요.
첫 번째 Amazon 음식 리뷰가 text라는 문자열로 제공되어 있어요. en_core_web_sm 모델은 nlp로 로드되어 있고, text에 적용해 텍스트 문자열을 담는 Doc 컨테이너 document를 만들어 두었어요.
text의 토큰을 담은 리스트인 tokens도 이미 준비되어 있어요.
이 연습은 강의의 일부입니다
spaCy로 배우는 자연어 처리
연습 안내
document의 모든 토큰에 대해 표제어를lemmas에 추가하고,lemmas리스트를 출력하세요.tokens리스트를 출력하고,tokens와lemmas의 차이를 관찰하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)