Karakter yang diuuulang
Kembali ke analisis sentimen Anda! Tugas berikutnya adalah mengganti kata-kata yang dipanjangkan yang muncul di tweet. Kita mendefinisikan kata yang dipanjangkan sebagai kata yang berisi karakter yang berulang dua kali atau lebih. mis. "Awesoooome".
Mengganti kata-kata tersebut sangat penting karena sebuah pengklasifikasi akan memperlakukan kata-kata itu sebagai istilah yang berbeda dari kata asalnya sehingga menurunkan frekuensinya.
Untuk menemukannya, Anda akan menggunakan capturing group dan merujuknya kembali menggunakan nomor. Mis. \4.
Jika Anda ingin menemukan kecocokan untuk Awesoooome. Anda perlu terlebih dahulu menangkap Awes. Lalu, cocokkan o dan rujuk kembali karakter yang sama, kemudian me.
Daftar sentiment_analysis, yang berisi teks dari tiga tweet, dan modul re sudah dimuat dalam sesi Anda. Anda dapat menggunakan print() untuk melihat datanya di IPython Shell.
Latihan ini merupakan bagian dari kursus
Regular Expressions in Python
Instruksi latihan
- Lengkapilah regular expression untuk mencocokkan kata yang dipanjangkan seperti yang dijelaskan.
- Telusuri elemen-elemen di dalam daftar
sentiment_analysisuntuk mengetahui apakah mengandung kata yang dipanjangkan. Simpan hasilnya kematch_elongated. - Tetapkan grup tangkapan bernomor nol ke variabel
elongated_word. - Cetak hasil yang tersimpan di variabel
elongated_word.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Complete the regex to match an elongated word
regex_elongated = r"____(____)____\w*"
for tweet in sentiment_analysis:
# Find if there is a match in each tweet
match_elongated = re.____(____, ____)
if match_elongated:
# Assign the captured group zero
elongated_word = match_elongated.____(____)
# Complete the format method to print the word
print("Elongated word found: {____}".format(word=____))
else:
print("No elongated word found")