Bắt đầu ngayBắt đầu miễn phí

Bước 2: Xây dựng vectorizer

Trong bài tập này, bạn sẽ xây dựng phép biến đổi TfIDf cho cột review trong bộ dữ liệu reviews. Bạn cần chỉ định các tham số n-grams, stop words, mẫu token và kích thước từ vựng.

Đây là bước cuối cùng trước khi chúng ta huấn luyện một bộ phân loại để dự đoán cảm xúc của một bài đánh giá.

Hãy đảm bảo bạn đặt đúng số lượng đặc trưng tối đa, vì kích thước từ vựng quá lớn có thể làm gián đoạn phiên làm việc của bạn.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Import Tfidf vectorizer và danh sách stop words tiếng Anh mặc định.
  • Xây dựng Tfidf vectorizer, lần lượt chỉ định các tham số sau: dùng danh sách stop words tiếng Anh mặc định; dùng uni-gram và bi-gram làm n-grams; số lượng đặc trưng tối đa là 200; chỉ bắt các từ theo mẫu đã cho.
  • Tạo một DataFrame bằng Tfidf vectorizer.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
Chỉnh sửa và Chạy Mã