시작하기무료로 시작하기

같은 데이터에 Tfidf와 BOW 적용하기

이 연습 문제에서는 Amazon 제품 reviewsreview 열을 대상으로 bag-of-words와 tfidf 변환을 모두 적용해 보겠습니다.

두 벡터라이저를 모두 구성하되, 최대 특성 수만 100으로 지정하세요. 변환 후 DataFrame을 만들고 각 DataFrame의 상위 5개 행을 출력하세요.

어휘집의 최대 특성 수를 지정하는 방법에 유의하세요. 어휘집 크기가 너무 크면 세션이 끊길 수 있습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Sentiment Analysis

강의 보기

연습 안내

  • BOW와 Tfidf 벡터라이저를 임포트하세요.
  • review 열에서 BOW와 Tfidf 벡터라이저를 생성하고 학습시키며, 생성되는 특성 수를 100으로 제한하세요.
  • 변환된 벡터 표현으로부터 DataFrame을 만드세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the required packages
____

# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____) 

# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers 
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())
코드 편집 및 실행