스테밍(Stemming)
이제 review 텍스트를 정제하고 불용어와 구두점을 제거했으니, 남은 단어들을 스테밍으로 정규화해 어근 형태로 줄여 보겠습니다. 이렇게 하면 유사한 단어를 묶어 분석을 더 일관되고 효율적으로 만들 수 있어요.
PorterStemmer 클래스와 clean_tokens 리스트가 제공되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Natural Language Processing (NLP)
연습 안내
PorterStemmer()를 초기화하세요.- 리스트 컴프리헨션을 사용해
clean_tokens리스트의 각 토큰에 스테밍을 적용하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']
# Create stemmer
stemmer = ____()
# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]
print(stemmed_tokens)