สร้างตัวจำแนกข้อความจากภาษาพูด
หลังจากถอดเสียงข้อมูลการโทรของลูกค้าแล้ว ตอนนี้เราจะสร้างโมเดลเพื่อจำแนกว่าข้อความจากการโทรนั้นเป็นประเภท pre_purchase หรือ post_purchase
เรามีตัวอย่างการโทรประเภท pre_purchase จำนวน 45 รายการ และ post_purchase จำนวน 57 รายการ
ข้อมูลที่ใช้ฝึกโมเดลเก็บอยู่ใน train_df และข้อมูลที่ใช้ทำนายเก็บอยู่ใน test_df
ลองพิมพ์ .head() ของแต่ละชุดข้อมูลออกมาดูที่คอนโซล
เราจะสร้าง sklearn pipeline โดยใช้ CountVectorizer() และ TfidfTransformer() เพื่อแปลงตัวอย่างข้อความให้เป็นตัวเลข จากนั้นใช้ตัวจำแนก MultinomialNB() เพื่อเรียนรู้ว่าแต่ละตัวอย่างอยู่ในหมวดหมู่ใด
โมเดลนี้จะทำงานได้ดีกับตัวอย่างขนาดเล็กแบบนี้ แต่หากมีข้อความจำนวนมากขึ้น อาจต้องพิจารณาใช้แนวทางที่ซับซ้อนกว่านี้
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Spoken Language Processing ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
('vectorizer', ____),
('tfidf', ____),
('classifier', ____),
])
# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)