시작하기무료로 시작하기

영화 리뷰의 어휘집 크기

이 연습 문제에서는 movies 리뷰 데이터셋의 샘플을 사용해 어휘집 크기를 제한하는 다양한 방법을 연습해 봅니다. 첫 번째 열은 object 타입의 review이고, 두 번째 열은 label로, 부정 리뷰는 0, 긍정 리뷰는 1입니다.

여러분이 사용할 세 가지 방법은 텍스트 열을 새로운 수치형 열로 변환하여 각 리뷰에서 단어 또는 어구의 등장 횟수를 담습니다. 각 방법은 최종적으로 만들어지는 새 특성의 개수가 서로 다르게 됩니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Sentiment Analysis

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)

# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
코드 편집 및 실행