제품 리뷰로 BOW 만들기
앞에서 작은 데이터셋으로 BOW를 연습해 보셨죠. 이제 Amazon 제품 리뷰 샘플에 적용해 보겠습니다. 데이터는 reviews라는 이름으로 불러와 두었고 두 개의 열이 있습니다. 첫 번째 열은 score이며, 리뷰가 부정이면 0, 긍정이면 1입니다. 두 번째 열은 review로, 고객이 작성한 리뷰 텍스트를 담고 있어요. IPython 셸에서 자유롭게 데이터를 살펴보셔도 됩니다.
이번 과제는 review 열을 사용해 BOW vocabulary를 만드는 것입니다.
벡터라이저에서 .get_feature_names() 메서드를 호출하면 vocabulary의 모든 요소 목록을 얻을 수 있다는 점을 기억하세요.
이 연습은 강의의 일부입니다
Python으로 배우는 Sentiment Analysis
연습 안내
- 최대 특성 수를 지정하여 CountVectorizer 객체를 생성하세요.
- 벡터라이저를 fit하세요.
- fit된 벡터라이저로 transform하세요.
- 희소 행렬을 밀집 배열로 변환한 뒤, 열 이름을 올바르게 지정하여 DataFrame을 생성하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify max features
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())