시작하기무료로 시작하기

고객 리뷰로 어휘집 구축하기

여러분은 소비자 전자제품 회사인 TechZone의 제품 분석 팀에 속해 있어요. 새로운 기기에 대한 고객 리뷰가 소량 도착했습니다. 리뷰를 분석하려면 먼저 텍스트를 전처리하고, 각 리뷰를 수치 데이터로 표현할 때 사용할 특징을 정의하는 고유 단어 목록, 즉 어휘집(vocabulary)을 만들어야 합니다.

preprocess() 함수가 미리 제공되어 있어요. 이 함수는 텍스트를 소문자로 바꾸고, 토큰화하며, 문장 부호를 제거합니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Natural Language Processing (NLP)

강의 보기

연습 안내

  • 데이터셋의 각 리뷰에 preprocess() 함수를 적용해 전처리하세요.
  • 전처리된 리뷰에 vectorizer를 적합(fit)하세요.
  • 생성된 어휘집을 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

reviews = [
    "The product is fantastic! It works like a charm.",
    "I hated the product. It broke after one use.",
    "Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]

vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary 
print(vectorizer.____)
코드 편집 및 실행