String Operators กับข้อมูล Twitter
ในแบบฝึกหัดนี้จะทำงานต่อกับชุดข้อมูล tweets ซึ่งคอลัมน์ text เก็บเนื้อหาของแต่ละทวีต
โจทย์คือแปลงคอลัมน์ text ให้เป็นรายการ token จากนั้นใช้ string operators เพื่อลบอักขระที่ไม่ใช่ตัวอักษรออกจากรายการ token ที่สร้างขึ้น
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Sentiment Analysis ด้วย Python
คำแนะนำการฝึกหัด
- Import ฟังก์ชัน tokenize คำ
- สร้าง token คำจากแต่ละทวีต
- กรองอักขระที่ไม่ใช่ตัวอักษรออกจากรายการที่สร้างขึ้น กล่าวคือ เก็บเฉพาะตัวอักษรเท่านั้น
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the word tokenizing package
____
# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])
# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])