고객 리뷰로 어휘집 구축하기
여러분은 소비자 전자제품 회사인 TechZone의 제품 분석 팀에 속해 있어요. 새로운 기기에 대한 고객 리뷰가 소량 도착했습니다. 리뷰를 분석하려면 먼저 텍스트를 전처리하고, 각 리뷰를 수치 데이터로 표현할 때 사용할 특징을 정의하는 고유 단어 목록, 즉 어휘집(vocabulary)을 만들어야 합니다.
preprocess() 함수가 미리 제공되어 있어요. 이 함수는 텍스트를 소문자로 바꾸고, 토큰화하며, 문장 부호를 제거합니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Natural Language Processing (NLP)
연습 안내
- 데이터셋의 각 리뷰에
preprocess()함수를 적용해 전처리하세요. - 전처리된 리뷰에
vectorizer를 적합(fit)하세요. - 생성된 어휘집을 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
reviews = [
"The product is fantastic! It works like a charm.",
"I hated the product. It broke after one use.",
"Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]
vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary
print(vectorizer.____)