Mulai sekarangMulai gratis

Karakter yang diuuulang

Kembali ke analisis sentimen Anda! Tugas berikutnya adalah mengganti kata-kata yang dipanjangkan yang muncul di tweet. Kita mendefinisikan kata yang dipanjangkan sebagai kata yang berisi karakter yang berulang dua kali atau lebih. mis. "Awesoooome".

Mengganti kata-kata tersebut sangat penting karena sebuah pengklasifikasi akan memperlakukan kata-kata itu sebagai istilah yang berbeda dari kata asalnya sehingga menurunkan frekuensinya.

Untuk menemukannya, Anda akan menggunakan capturing group dan merujuknya kembali menggunakan nomor. Mis. \4.

Jika Anda ingin menemukan kecocokan untuk Awesoooome. Anda perlu terlebih dahulu menangkap Awes. Lalu, cocokkan o dan rujuk kembali karakter yang sama, kemudian me.

Daftar sentiment_analysis, yang berisi teks dari tiga tweet, dan modul re sudah dimuat dalam sesi Anda. Anda dapat menggunakan print() untuk melihat datanya di IPython Shell.

Latihan ini merupakan bagian dari kursus

Regular Expressions in Python

Lihat Kursus

Instruksi latihan

  • Lengkapilah regular expression untuk mencocokkan kata yang dipanjangkan seperti yang dijelaskan.
  • Telusuri elemen-elemen di dalam daftar sentiment_analysis untuk mengetahui apakah mengandung kata yang dipanjangkan. Simpan hasilnya ke match_elongated.
  • Tetapkan grup tangkapan bernomor nol ke variabel elongated_word.
  • Cetak hasil yang tersimpan di variabel elongated_word.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Complete the regex to match an elongated word
regex_elongated = r"____(____)____\w*"

for tweet in sentiment_analysis:
	# Find if there is a match in each tweet 
	match_elongated = re.____(____, ____)
    
	if match_elongated:
		# Assign the captured group zero 
		elongated_word = match_elongated.____(____)
        
		# Complete the format method to print the word
		print("Elongated word found: {____}".format(word=____))
	else:
		print("No elongated word found") 
Edit dan Jalankan Kode