Bắt đầu ngayBắt đầu miễn phí

Mọi thứ gọn gàng

Quay lại dự án phân tích cảm xúc trên Twitter của bạn! Có một số loại chuỗi làm tăng độ phức tạp khi phân tích cảm xúc, nhưng chúng không cung cấp thông tin hữu ích. Trong số đó có thể có liên kết và nhắc đến người dùng.

Để làm sạch các tweet, trước hết bạn muốn trích xuất một vài ví dụ. Bạn biết rằng đa số liên kết bắt đầu bằng http và không chứa khoảng trắng, ví dụ https://www.datacamp.com. Lượt nhắc đến người dùng bắt đầu bằng @ và chỉ có thể gồm chữ cái và số, ví dụ @johnsmith3.

Bạn ghi lại một số lượng từ hữu ích để hỗ trợ: * không hoặc nhiều lần, + một hoặc nhiều lần, ? không hoặc một lần.

Danh sách sentiment_analysis chứa văn bản của ba tweet đã được nạp sẵn trong phiên của bạn. Bạn có thể dùng print() để xem dữ liệu trong IPython Shell.

Bài tập này là một phần của khóa học

Regular Expressions in Python

Xem khóa học

Hướng dẫn bài tập

  • Import mô-đun re.
  • Viết một regex để tìm tất cả các kết quả khớp là liên kết http xuất hiện trong mỗi tweet trong sentiment_analysis. In kết quả ra.
  • Viết một regex để tìm tất cả các kết quả khớp là lượt nhắc đến người dùng xuất hiện trong mỗi tweet trong sentiment_analysis. In kết quả ra.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Chỉnh sửa và Chạy Mã