시작하기무료로 시작하기

블로그 게시글 정리하기

이 연습 문제에서는 블로그 게시글 일부가 주어집니다. 이 텍스트를 머신이 더 잘 다룰 수 있는 형식으로 정리하세요. 소문자 변환, 표제어 추출(레마화), 불용어 제거, 구두점 제거, 알파벳 이외 문자의 제거가 포함됩니다.

발췌문은 문자열 blog로 제공되며 콘솔에 출력되어 있습니다. 불용어 목록은 stopwords로 제공됩니다.

이 연습은 강의의 일부입니다

Python으로 배우는 NLP 피처 엔지니어링

강의 보기

연습 안내

  • 리스트 컴프리헨션을 사용해 doc을 순회하며 각 토큰의 lemma_를 추출하세요.
  • stopwordsisalpha()를 사용해 불용어와 알파벳이 아닌 토큰을 제거하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
코드 편집 및 실행