การพยากรณ์แบบ Classification
ในการตรวจสอบความถูกต้องของโมเดล สิ่งสำคัญคือการรู้ข้อมูลเพิ่มเติมเกี่ยวกับผลการพยากรณ์ ไม่ใช่แค่ผลจำแนกประเภทขั้นสุดท้ายเท่านั้น เมื่อพยากรณ์ว่าทีมใดจะชนะ ส่วนใหญ่ยังอยากรู้ด้วยว่า โอกาสที่ทีมนั้นจะชนะมีมากแค่ไหน
| ความน่าจะเป็น | ผลพยากรณ์ | ความหมาย |
|---|---|---|
| 0 < .50 | 0 | ทีมแพ้ |
| .50 + | 1 | ทีมชนะ |
ในแบบฝึกหัดนี้ ให้ศึกษาการใช้เมธอด .predict() และ .predict_proba() กับชุดข้อมูล tic_tac_toe เมธอดแรกจะให้ผลพยากรณ์ว่าผู้เล่นคนที่หนึ่งจะชนะหรือไม่ ส่วนเมธอดที่สองจะให้ค่าความน่าจะเป็นที่ผู้เล่นคนที่หนึ่งจะชนะ ใช้ rfc เป็นโมเดล random forest classification
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจสอบความถูกต้องของโมเดลใน Python
คำแนะนำการฝึกหัด
- สร้างอาร์เรย์ผลพยากรณ์ 2 ชุด ชุดหนึ่งสำหรับค่าจำแนกประเภท และอีกชุดสำหรับค่าความน่าจะเป็นของการพยากรณ์
- ใช้เมธอด
.value_counts()กับ pandas Series เพื่อแสดงจำนวนการสังเกตการณ์ที่ถูกจัดอยู่ในแต่ละคลาส - แสดงการสังเกตการณ์แรกของ
probability_predictionsเพื่อดูโครงสร้างของค่าความน่าจะเป็น
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Fit the rfc model.
rfc.fit(X_train, y_train)
# Create arrays of predictions
classification_predictions = rfc.____(X_test)
probability_predictions = rfc.____(X_test)
# Print out count of binary predictions
print(pd.Series(____).____())
# Print the first value from probability_predictions
print('The first predicted probabilities are: {}'.format(____[____]))