같은 데이터에 Tfidf와 BOW 적용하기
이 연습 문제에서는 Amazon 제품 reviews의 review 열을 대상으로 bag-of-words와 tfidf 변환을 모두 적용해 보겠습니다.
두 벡터라이저를 모두 구성하되, 최대 특성 수만 100으로 지정하세요. 변환 후 DataFrame을 만들고 각 DataFrame의 상위 5개 행을 출력하세요.
어휘집의 최대 특성 수를 지정하는 방법에 유의하세요. 어휘집 크기가 너무 크면 세션이 끊길 수 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Sentiment Analysis
연습 안내
- BOW와 Tfidf 벡터라이저를 임포트하세요.
review열에서 BOW와 Tfidf 벡터라이저를 생성하고 학습시키며, 생성되는 특성 수를 100으로 제한하세요.- 변환된 벡터 표현으로부터 DataFrame을 만드세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import the required packages
____
# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____)
# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())