Mulai sekarangMulai gratis

Semua bersih

Kembali ke proyek analisis sentimen Twitter Anda! Ada beberapa jenis string yang meningkatkan kompleksitas analisis sentimen Anda. Namun, string-string ini tidak memberikan sentimen yang berguna. Di antaranya, terdapat tautan dan sebutan pengguna.

Untuk membersihkan tweet, Anda ingin mengekstrak beberapa contohnya terlebih dahulu. Anda tahu bahwa sebagian besar waktu tautan dimulai dengan http dan tidak mengandung spasi, misalnya https://www.datacamp.com. Sebutan pengguna dimulai dengan @ dan hanya dapat berisi huruf dan angka, misalnya @johnsmith3.

Anda menuliskan beberapa kuantifier yang membantu: * nol atau lebih kali, + satu kali atau lebih, ? nol atau satu kali.

Daftar sentiment_analysis yang berisi teks dari tiga tweet sudah dimuat dalam sesi Anda. Anda dapat menggunakan print() untuk melihat datanya di IPython Shell.

Latihan ini merupakan bagian dari kursus

Regular Expressions in Python

Lihat Kursus

Instruksi latihan

  • Impor modul re.
  • Tulis sebuah regex untuk menemukan semua kecocokan tautan http yang muncul di setiap tweet dalam sentiment_analysis. Cetak hasilnya.
  • Tulis sebuah regex untuk menemukan semua kecocokan sebutan pengguna yang muncul di setiap tweet dalam sentiment_analysis. Cetak hasilnya.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Edit dan Jalankan Kode