Bắt đầu ngayBắt đầu miễn phí

Chỉ định độ dài chuỗi token với BOW

Trong video, bạn đã thấy rằng khi chỉ định các độ dài token khác nhau — gọi là n-gram — ta có thể nắm bắt ngữ cảnh tốt hơn, điều này có thể rất quan trọng.

Trong bài tập này, bạn sẽ làm việc với một mẫu đánh giá sản phẩm trên Amazon. Nhiệm vụ của bạn là xây dựng từ vựng BOW, sử dụng cột review và chỉ định độ dài chuỗi token.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Xây dựng vectorizer, chỉ định độ dài chuỗi token là uni- và bigram.
  • Fit vectorizer.
  • Transform vectorizer đã fit.
  • Trong DataFrame, đảm bảo chỉ định đúng tên các cột.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
Chỉnh sửa và Chạy Mã