Bắt đầu ngayBắt đầu miễn phí

Tìm tệp

Bạn vẫn chưa hài lòng với việc làm sạch bộ dữ liệu tweets. Vẫn còn những chuỗi thừa không mang cảm xúc nào. Trong số đó có các chuỗi trỏ tới tên tệp văn bản.

Bạn cũng tìm ra cách để nhận diện chúng:

  • Chúng xuất hiện ở đầu chuỗi.
  • Chúng luôn bắt đầu bằng một chuỗi 2 hoặc 3 nguyên âm viết hoa hoặc viết thường (a e i o u).
  • Chúng luôn kết thúc với hậu tố txt.

Bạn chưa chắc có nên xóa chúng ngay hay không. Vì vậy bạn viết một script để tìm và lưu chúng vào một bộ dữ liệu riêng.

Bạn ghi lại một số metacharacter để hỗ trợ: ^ neo về đầu chuỗi, . là bất kỳ ký tự nào.

Biến sentiment_analysis chứa văn bản của hai tweet cũng như mô-đun re đã được nạp sẵn trong phiên của bạn. Bạn có thể dùng print() để xem trong IPython Shell.

Bài tập này là một phần của khóa học

Regular Expressions in Python

Xem khóa học

Hướng dẫn bài tập

  • Viết một regex khớp với mẫu tên tệp văn bản, ví dụ aemyfile.txt.
  • Tìm tất cả kết quả khớp của regex trong các phần tử của sentiment_analysis. In kết quả.
  • Thay thế tất cả kết quả khớp của regex bằng chuỗi rỗng "". In kết quả.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
Chỉnh sửa và Chạy Mã