การจำแนกประเภทข้อความด้วยเวกเตอร์ tf/idf
หลังจากที่เข้ารหัสคอลัมน์ title ของชุดข้อมูล volunteer เป็นเวกเตอร์ tf/idf แล้ว ขั้นตอนนี้จะนำเวกเตอร์เหล่านั้นมาใช้พยากรณ์คอลัมน์ category_desc
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การเตรียมข้อมูลสำหรับ Machine Learning ด้วย Python
คำแนะนำการฝึกหัด
- แบ่งเวกเตอร์
text_tfidfและตัวแปรเป้าหมายyออกเป็นชุดฝึกและชุดทดสอบ โดยตั้งค่าพารามิเตอร์stratifyเป็นyเนื่องจากการกระจายของคลาสไม่สมดุล สังเกตว่าต้องเรียกเมธอด.toarray()บนเวกเตอร์ tf/idf เพื่อแปลงให้อยู่ในรูปแบบที่ scikit-learn รองรับ - ฟิตข้อมูล
X_trainและy_trainเข้ากับโมเดล Naive Bayesnb - แสดงค่าความแม่นยำของชุดทดสอบ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)
# Fit the model to the training data
nb.____(____, ____)
# Print out the model's accuracy
print(nb.____(____, ____))