Bắt đầu ngayBắt đầu miễn phí

TfIdf đầu tiên của bạn

Trong bài tập này, bạn sẽ áp dụng phương pháp TfIdf cho dataset nhỏ annak, chứa câu đầu tiên của Anna Karenina của Leo Tolstoy.

Nhiệm vụ của bạn là làm việc với dataset này và áp dụng hàm TfidfVectorizer(). Hãy nhớ rằng việc biến đổi văn bản thành dạng số là bước đầu tiên để bạn có thể hiểu được cảm xúc trong văn bản. Bộ vector hóa Tfidf là một cách khác để xây dựng bộ từ vựng từ cột cảm xúc của chúng ta.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Import hàm để xây dựng bộ vector hóa TfIdf từ sklearn.feature_extraction.text.
  • Gọi hàm TfidfVectorizer() và fit nó trên dataset annak.
  • Thực hiện transform với bộ vector hóa.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Call the vectorizer and fit it
anna_vect = ____.___(annak)

# Create the tfidf representation
anna_tfidf = anna_vect.____(annak)

# Print the result 
print(anna_tfidf.toarray())
Chỉnh sửa và Chạy Mã