Mọi thứ gọn gàng
Quay lại dự án phân tích cảm xúc trên Twitter của bạn! Có một số loại chuỗi làm tăng độ phức tạp khi phân tích cảm xúc, nhưng chúng không cung cấp thông tin hữu ích. Trong số đó có thể có liên kết và nhắc đến người dùng.
Để làm sạch các tweet, trước hết bạn muốn trích xuất một vài ví dụ. Bạn biết rằng đa số liên kết bắt đầu bằng http và không chứa khoảng trắng, ví dụ https://www.datacamp.com. Lượt nhắc đến người dùng bắt đầu bằng @ và chỉ có thể gồm chữ cái và số, ví dụ @johnsmith3.
Bạn ghi lại một số lượng từ hữu ích để hỗ trợ: * không hoặc nhiều lần, + một hoặc nhiều lần, ? không hoặc một lần.
Danh sách sentiment_analysis chứa văn bản của ba tweet đã được nạp sẵn trong phiên của bạn. Bạn có thể dùng print() để xem dữ liệu trong IPython Shell.
Bài tập này là một phần của khóa học
Regular Expressions in Python
Hướng dẫn bài tập
- Import mô-đun
re. - Viết một regex để tìm tất cả các kết quả khớp là liên kết
httpxuất hiện trong mỗitweettrongsentiment_analysis. In kết quả ra. - Viết một regex để tìm tất cả các kết quả khớp là lượt nhắc đến người dùng xuất hiện trong mỗi
tweettrongsentiment_analysis. In kết quả ra.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))