영화 리뷰를 위한 BoW 벡터
이 연습 문제에서는 영화 리뷰로 구성된 두 개의 pandas Series, X_train과 X_test가 제공됩니다. 각각 학습용과 테스트용 리뷰 데이터예요. 여러분의 과제는 리뷰를 전처리하고 CountVectorizer를 사용해 두 데이터셋에 대한 BoW 벡터를 생성하는 것입니다.
BoW 벡터 행렬 X_train_bow와 X_test_bow를 만들고 나면, 여기에 Machine Learning 모델을 적용해 감성 분석을 수행할 아주 좋은 준비가 됩니다.
이 연습은 강의의 일부입니다
Python으로 배우는 NLP 피처 엔지니어링
연습 안내
sklearn라이브러리에서CountVectorizer를 가져오세요.- 모든 단어를 소문자로 변환하고
english불용어를 제거하도록 설정하여vectorizer라는 이름의CountVectorizer객체를 생성하세요. X_train을 사용해vectorizer를 학습(fit)한 다음, 이를 사용해X_train을 변환하여 BoW 벡터 집합X_train_bow를 생성하세요.vectorizer로X_test를 변환하여 BoW 벡터 집합X_test_bow를 생성하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)