Bắt đầu ngayBắt đầu miễn phí

BOW với n-gram và kích thước từ vựng

Trong bài tập này, bạn sẽ thực hành xây dựng bag-of-words thêm một lần nữa, sử dụng tập dữ liệu reviews gồm các đánh giá sản phẩm trên Amazon. Nhiệm vụ chính của bạn là giới hạn kích thước từ vựng và chỉ định độ dài chuỗi token.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Import vectorizer từ sklearn.
  • Xây dựng vectorizer và đảm bảo chỉ định các tham số sau: kích thước từ vựng giới hạn ở 1000, chỉ bao gồm bigram, và bỏ qua các thuật ngữ xuất hiện trong hơn 500 tài liệu.
  • Fit vectorizer vào cột review.
  • Tạo một DataFrame từ biểu diễn BOW.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
Chỉnh sửa và Chạy Mã