เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

String Operators กับข้อมูล Twitter

ในแบบฝึกหัดนี้จะทำงานต่อกับชุดข้อมูล tweets ซึ่งคอลัมน์ text เก็บเนื้อหาของแต่ละทวีต

โจทย์คือแปลงคอลัมน์ text ให้เป็นรายการ token จากนั้นใช้ string operators เพื่อลบอักขระที่ไม่ใช่ตัวอักษรออกจากรายการ token ที่สร้างขึ้น

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Sentiment Analysis ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import ฟังก์ชัน tokenize คำ
  • สร้าง token คำจากแต่ละทวีต
  • กรองอักขระที่ไม่ใช่ตัวอักษรออกจากรายการที่สร้างขึ้น กล่าวคือ เก็บเฉพาะตัวอักษรเท่านั้น

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
แก้ไขและรันโค้ด