ฝึกโมเดล Naive Bayes พร้อมการเลือกฟีเจอร์
ตอนนี้จะรันโมเดลจำแนกข้อความ Naive Bayes อีกครั้ง เหมือนที่ทำไว้ตอนท้ายของบทที่ 3 โดยใช้ตัวเลือกฟีเจอร์จากแบบฝึกหัดก่อนหน้า ได้แก่ คอลัมน์ title และ category_desc ของชุดข้อมูล volunteer
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การเตรียมข้อมูลสำหรับ Machine Learning ด้วย Python
คำแนะนำการฝึกหัด
- ใช้
train_test_split()กับเวกเตอร์ข้อความfiltered_textและ labely(ซึ่งคือ label ของcategory_desc) แล้วส่งyไปยังพารามิเตอร์stratifyเนื่องจากข้อมูลแต่ละคลาสมีจำนวนไม่เท่ากัน - Fit โมเดล Naive Bayes
nbกับX_trainและy_train - คำนวณความแม่นยำของ
nbบนชุดข้อมูลทดสอบ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Split the dataset according to the class distribution of category_desc
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, stratify=____, random_state=42)
# Fit the model to the training data
nb.____
# Print out the model's accuracy
print(nb.____)