เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การจำแนกประเภทข้อความด้วยเวกเตอร์ tf/idf

หลังจากที่เข้ารหัสคอลัมน์ title ของชุดข้อมูล volunteer เป็นเวกเตอร์ tf/idf แล้ว ขั้นตอนนี้จะนำเวกเตอร์เหล่านั้นมาใช้พยากรณ์คอลัมน์ category_desc

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การเตรียมข้อมูลสำหรับ Machine Learning ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แบ่งเวกเตอร์ text_tfidf และตัวแปรเป้าหมาย y ออกเป็นชุดฝึกและชุดทดสอบ โดยตั้งค่าพารามิเตอร์ stratify เป็น y เนื่องจากการกระจายของคลาสไม่สมดุล สังเกตว่าต้องเรียกเมธอด .toarray() บนเวกเตอร์ tf/idf เพื่อแปลงให้อยู่ในรูปแบบที่ scikit-learn รองรับ
  • ฟิตข้อมูล X_train และ y_train เข้ากับโมเดล Naive Bayes nb
  • แสดงค่าความแม่นยำของชุดทดสอบ

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)

# Fit the model to the training data
nb.____(____, ____)

# Print out the model's accuracy
print(nb.____(____, ____))
แก้ไขและรันโค้ด