TfIdf đầu tiên của bạn
Trong bài tập này, bạn sẽ áp dụng phương pháp TfIdf cho dataset nhỏ annak, chứa câu đầu tiên của Anna Karenina của Leo Tolstoy.
Nhiệm vụ của bạn là làm việc với dataset này và áp dụng hàm TfidfVectorizer(). Hãy nhớ rằng việc biến đổi văn bản thành dạng số là bước đầu tiên để bạn có thể hiểu được cảm xúc trong văn bản. Bộ vector hóa Tfidf là một cách khác để xây dựng bộ từ vựng từ cột cảm xúc của chúng ta.
Bài tập này là một phần của khóa học
Phân tích cảm xúc với Python
Hướng dẫn bài tập
- Import hàm để xây dựng bộ vector hóa TfIdf từ
sklearn.feature_extraction.text. - Gọi hàm
TfidfVectorizer()và fit nó trên datasetannak. - Thực hiện transform với bộ vector hóa.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Call the vectorizer and fit it
anna_vect = ____.___(annak)
# Create the tfidf representation
anna_tfidf = anna_vect.____(annak)
# Print the result
print(anna_tfidf.toarray())