Menemukan berkas
Anda belum puas dengan pembersihan himpunan data tweet Anda. Masih ada string tambahan yang tidak memberikan sentimen. Di antaranya ada string yang merujuk pada nama berkas teks.
Anda juga menemukan cara untuk mendeteksinya:
- Muncul di awal string.
- Selalu diawali dengan urutan 2 atau 3 huruf vokal, huruf besar atau kecil (a e i o u).
- Selalu diakhiri dengan akhiran
txt.
Anda belum yakin apakah harus langsung menghapusnya. Jadi Anda menulis skrip untuk menemukan dan menyimpannya dalam himpunan data terpisah.
Anda menuliskan beberapa metakarakter untuk membantu: ^ jangkar ke awal, . karakter apa pun.
Variabel sentiment_analysis yang berisi teks dari dua tweet serta modul re sudah dimuat dalam sesi Anda. Anda dapat menggunakan print() untuk melihatnya di IPython Shell.
Latihan ini merupakan bagian dari kursus
Regular Expressions in Python
Instruksi latihan
- Tulis sebuah regex yang mencocokkan pola nama berkas teks, misalnya
aemyfile.txt. - Temukan semua kecocokan regex di elemen-elemen
sentiment_analysis. Cetak hasilnya. - Ganti semua kecocokan regex dengan string kosong
"". Cetak hasilnya.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))