Bắt đầu ngayBắt đầu miễn phí

Chỉ định mẫu token

Trong bài tập này, bạn sẽ làm việc với cột text của tập dữ liệu tweets. Nhiệm vụ của bạn là biến đổi cột kiểu object thành vector bằng CountVectorizer. Bạn sẽ áp dụng các mẫu token khác nhau trong vectorizer. Hãy nhớ rằng bằng cách chỉ định mẫu token, bạn có thể lọc bớt các ký tự.

CountVectorizer đã được nhập sẵn cho bạn.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))
Chỉnh sửa và Chạy Mã