BOW với n-gram và kích thước từ vựng
Trong bài tập này, bạn sẽ thực hành xây dựng bag-of-words thêm một lần nữa, sử dụng tập dữ liệu reviews gồm các đánh giá sản phẩm trên Amazon. Nhiệm vụ chính của bạn là giới hạn kích thước từ vựng và chỉ định độ dài chuỗi token.
Bài tập này là một phần của khóa học
Phân tích cảm xúc với Python
Hướng dẫn bài tập
- Import vectorizer từ
sklearn. - Xây dựng vectorizer và đảm bảo chỉ định các tham số sau: kích thước từ vựng giới hạn ở 1000, chỉ bao gồm bigram, và bỏ qua các thuật ngữ xuất hiện trong hơn 500 tài liệu.
- Fit vectorizer vào cột
review. - Tạo một DataFrame từ biểu diễn BOW.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())