Mendapatkan token
Langkah berikutnya adalah melakukan tokenisasi pada teks tweet Anda. Tokenisasi adalah proses memecah string menjadi unit leksikal atau, sederhananya, kata-kata. Namun terlebih dahulu, Anda perlu menghapus tagar agar tidak mengganggu proses. Anda menyadari bahwa tagar diawali dengan simbol # dan berisi huruf serta angka, tetapi tidak pernah berisi spasi. Setelah itu, Anda berencana membagi teks pada kecocokan spasi kosong untuk mendapatkan token.
Anda membawa daftar kuantifier untuk membantu: * nol kali atau lebih, + satu kali atau lebih, ? nol atau satu kali, {n, m} minimum n, maksimum m.
Variabel sentiment_analysis yang berisi teks dari satu tweet serta modul re sudah dimuat dalam sesi Anda. Anda dapat menggunakan print(sentiment_analysis) untuk melihatnya di IPython Shell.
Latihan ini merupakan bagian dari kursus
Regular Expressions in Python
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Write a regex matching the hashtag pattern
regex = r"____"