Chỉ định mẫu token
Trong bài tập này, bạn sẽ làm việc với cột text của tập dữ liệu tweets. Nhiệm vụ của bạn là biến đổi cột kiểu object thành vector bằng CountVectorizer. Bạn sẽ áp dụng các mẫu token khác nhau trong vectorizer. Hãy nhớ rằng bằng cách chỉ định mẫu token, bạn có thể lọc bớt các ký tự.
CountVectorizer đã được nhập sẵn cho bạn.
Bài tập này là một phần của khóa học
Phân tích cảm xúc với Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))