n-그램과 어휘 사전 크기를 활용한 BOW
이 연습 문제에서는 Amazon 상품 리뷰인 reviews 데이터셋을 사용해 다시 한 번 bag-of-words를 만들어 보겠습니다. 핵심 과제는 어휘 사전의 크기를 제한하고 토큰 시퀀스의 길이를 지정하는 것입니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Sentiment Analysis
연습 안내
sklearn에서 벡터라이저를 가져오세요.- 벡터라이저를 구성할 때 다음 매개변수를 지정하세요: 어휘 사전 크기는 1000으로 제한하고, 바이그램만 포함하며, 500개를 초과하는 문서에 등장하는 용어는 무시합니다.
- 벡터라이저를
review열에 맞춥니다(fit). - BOW 표현으로부터 DataFrame을 만드세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())