Semua bersih
Kembali ke proyek analisis sentimen Twitter Anda! Ada beberapa jenis string yang meningkatkan kompleksitas analisis sentimen Anda. Namun, string-string ini tidak memberikan sentimen yang berguna. Di antaranya, terdapat tautan dan sebutan pengguna.
Untuk membersihkan tweet, Anda ingin mengekstrak beberapa contohnya terlebih dahulu. Anda tahu bahwa sebagian besar waktu tautan dimulai dengan http dan tidak mengandung spasi, misalnya https://www.datacamp.com. Sebutan pengguna dimulai dengan @ dan hanya dapat berisi huruf dan angka, misalnya @johnsmith3.
Anda menuliskan beberapa kuantifier yang membantu: * nol atau lebih kali, + satu kali atau lebih, ? nol atau satu kali.
Daftar sentiment_analysis yang berisi teks dari tiga tweet sudah dimuat dalam sesi Anda. Anda dapat menggunakan print() untuk melihat datanya di IPython Shell.
Latihan ini merupakan bagian dari kursus
Regular Expressions in Python
Instruksi latihan
- Impor modul
re. - Tulis sebuah regex untuk menemukan semua kecocokan tautan
httpyang muncul di setiaptweetdalamsentiment_analysis. Cetak hasilnya. - Tulis sebuah regex untuk menemukan semua kecocokan sebutan pengguna yang muncul di setiap
tweetdalamsentiment_analysis. Cetak hasilnya.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))