เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ระบุรูปแบบของโทเคน

ในแบบฝึกหัดนี้ คุณจะทำงานกับคอลัมน์ text ของชุดข้อมูล tweets โดยมีหน้าที่แปลงคอลัมน์ดังกล่าวให้เป็นเวกเตอร์ด้วย CountVectorizer และทดลองใช้รูปแบบโทเคนที่แตกต่างกัน การระบุรูปแบบโทเคนช่วยให้กรองอักขระที่ไม่ต้องการออกได้

นำเข้า CountVectorizer ให้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Sentiment Analysis ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))
แก้ไขและรันโค้ด