เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

สร้างตัวจำแนกข้อความจากภาษาพูด

หลังจากถอดเสียงข้อมูลการโทรของลูกค้าแล้ว ตอนนี้เราจะสร้างโมเดลเพื่อจำแนกว่าข้อความจากการโทรนั้นเป็นประเภท pre_purchase หรือ post_purchase

เรามีตัวอย่างการโทรประเภท pre_purchase จำนวน 45 รายการ และ post_purchase จำนวน 57 รายการ

ข้อมูลที่ใช้ฝึกโมเดลเก็บอยู่ใน train_df และข้อมูลที่ใช้ทำนายเก็บอยู่ใน test_df

ลองพิมพ์ .head() ของแต่ละชุดข้อมูลออกมาดูที่คอนโซล

เราจะสร้าง sklearn pipeline โดยใช้ CountVectorizer() และ TfidfTransformer() เพื่อแปลงตัวอย่างข้อความให้เป็นตัวเลข จากนั้นใช้ตัวจำแนก MultinomialNB() เพื่อเรียนรู้ว่าแต่ละตัวอย่างอยู่ในหมวดหมู่ใด

โมเดลนี้จะทำงานได้ดีกับตัวอย่างขนาดเล็กแบบนี้ แต่หากมีข้อความจำนวนมากขึ้น อาจต้องพิจารณาใช้แนวทางที่ซับซ้อนกว่านี้

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Spoken Language Processing ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
    ('vectorizer', ____),
    ('tfidf', ____),
    ('classifier', ____),
])

# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)
แก้ไขและรันโค้ด