Bắt đầu ngayBắt đầu miễn phí

Hiểu sự khác biệt

Bạn cần tiếp tục xử lý và làm sạch bộ dữ liệu tweet của mình. Bạn nhận ra rằng có một số thẻ HTML xuất hiện. Bạn cần loại bỏ các thẻ đó nhưng vẫn giữ nguyên nội dung bên trong vì chúng hữu ích cho việc phân tích.

Hãy xem câu sau có chứa một thẻ HTML:

I want to see that <strong>amazing show</strong> again!.

Bạn biết rằng để lấy thẻ HTML, bạn cần khớp mọi thứ nằm trong ngoặc nhọn < >. Nhưng vấn đề lớn nhất là thẻ đóng có cùng cấu trúc. Nếu khớp quá nhiều, bạn sẽ vô tình xóa thông tin quan trọng. Vì vậy, bạn cần quyết định dùng lượng từ tham lam (greedy) hay lười (lazy).

Chuỗi đã được nạp sẵn vào phiên làm việc dưới tên string.

Bài tập này là một phần của khóa học

Regular Expressions in Python

Xem khóa học

Hướng dẫn bài tập

  • Import mô-đun re.
  • Viết biểu thức regex để thay thế các thẻ HTML bằng chuỗi rỗng.
  • In ra kết quả.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
Chỉnh sửa và Chạy Mã