สร้างโมเดลจากชุดข้อมูล UFO ตอนที่ 2
ขั้นตอนสุดท้าย เราจะสร้างโมเดลโดยใช้ text vector ที่สร้างไว้ คือ desc_tfidf และใช้ลิสต์ filtered_words เพื่อกรอง text vector ลองดูว่าจะสามารถทำนาย type ของการพบเห็นจากข้อความได้หรือไม่ โดยจะใช้โมเดล Naive Bayes ในแบบฝึกหัดนี้
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การเตรียมข้อมูลสำหรับ Machine Learning ด้วย Python
คำแนะนำการฝึกหัด
- กรอง vector
desc_tfidfโดยส่งลิสต์ของfiltered_wordsเข้าไปใน index - แบ่ง features
filtered_textและyออกเป็นชุด train และ test โดยให้การกระจายของแต่ละคลาสเท่ากัน และกำหนดrandom_stateเป็น42 - ใช้เมธอด
.fit()ของโมเดลnbเพื่อ fitX_trainและy_train - แสดงผลลัพธ์
.score()ของโมเดลnbบนชุดX_testและy_test
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Use the list of filtered words we created to filter the text vector
filtered_text = ____[:, list(____)]
# Split the X and y sets using train_test_split, setting stratify=y
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____, random_state=42)
# Fit nb to the training sets
____
# Print the score of nb on the test sets
____