ระบุรูปแบบของโทเคน
ในแบบฝึกหัดนี้ คุณจะทำงานกับคอลัมน์ text ของชุดข้อมูล tweets โดยมีหน้าที่แปลงคอลัมน์ดังกล่าวให้เป็นเวกเตอร์ด้วย CountVectorizer และทดลองใช้รูปแบบโทเคนที่แตกต่างกัน การระบุรูปแบบโทเคนช่วยให้กรองอักขระที่ไม่ต้องการออกได้
นำเข้า CountVectorizer ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Sentiment Analysis ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))