영화 리뷰의 어휘집 크기
이 연습 문제에서는 movies 리뷰 데이터셋의 샘플을 사용해 어휘집 크기를 제한하는 다양한 방법을 연습해 봅니다. 첫 번째 열은 object 타입의 review이고, 두 번째 열은 label로, 부정 리뷰는 0, 긍정 리뷰는 1입니다.
여러분이 사용할 세 가지 방법은 텍스트 열을 새로운 수치형 열로 변환하여 각 리뷰에서 단어 또는 어구의 등장 횟수를 담습니다. 각 방법은 최종적으로 만들어지는 새 특성의 개수가 서로 다르게 됩니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Sentiment Analysis
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)
# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())