Tìm tệp
Bạn vẫn chưa hài lòng với việc làm sạch bộ dữ liệu tweets. Vẫn còn những chuỗi thừa không mang cảm xúc nào. Trong số đó có các chuỗi trỏ tới tên tệp văn bản.
Bạn cũng tìm ra cách để nhận diện chúng:
- Chúng xuất hiện ở đầu chuỗi.
- Chúng luôn bắt đầu bằng một chuỗi 2 hoặc 3 nguyên âm viết hoa hoặc viết thường (a e i o u).
- Chúng luôn kết thúc với hậu tố
txt.
Bạn chưa chắc có nên xóa chúng ngay hay không. Vì vậy bạn viết một script để tìm và lưu chúng vào một bộ dữ liệu riêng.
Bạn ghi lại một số metacharacter để hỗ trợ: ^ neo về đầu chuỗi, . là bất kỳ ký tự nào.
Biến sentiment_analysis chứa văn bản của hai tweet cũng như mô-đun re đã được nạp sẵn trong phiên của bạn. Bạn có thể dùng print() để xem trong IPython Shell.
Bài tập này là một phần của khóa học
Regular Expressions in Python
Hướng dẫn bài tập
- Viết một regex khớp với mẫu tên tệp văn bản, ví dụ
aemyfile.txt. - Tìm tất cả kết quả khớp của regex trong các phần tử của
sentiment_analysis. In kết quả. - Thay thế tất cả kết quả khớp của regex bằng chuỗi rỗng
"". In kết quả.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))