Tách token
Bước tiếp theo là tách token cho văn bản các tweet của bạn. Tokenization là quá trình chia một chuỗi thành các đơn vị từ vựng, nói đơn giản là thành các từ. Nhưng trước hết, bạn cần loại bỏ hashtag để chúng không làm nhiễu quá trình. Bạn nhận ra rằng hashtag bắt đầu bằng ký tự # và chứa chữ cái hoặc chữ số nhưng không bao giờ có khoảng trắng. Sau đó, bạn dự định tách văn bản tại các vị trí khớp khoảng trắng để lấy các token.
Bạn có sẵn danh sách lượng tử để hỗ trợ: * không hoặc nhiều lần, + một hoặc nhiều lần, ? không hoặc một lần, {n, m} tối thiểu n, tối đa m.
Biến sentiment_analysis chứa văn bản của một tweet và mô-đun re đã được nạp trong phiên của bạn. Bạn có thể dùng print(sentiment_analysis) để xem trong IPython Shell.
Bài tập này là một phần của khóa học
Regular Expressions in Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Write a regex matching the hashtag pattern
regex = r"____"