การพยากรณ์รายได้ภาพยนตร์
เริ่มต้นการพยากรณ์รายได้ภาพยนตร์ด้วยการสร้าง Linear Regression อย่างง่าย เพื่อประมาณค่า log-revenue ของภาพยนตร์จากฟีเจอร์ 'budget' เมตริกที่ใช้ในแบบฝึกหัดนี้คือ RMSE (root mean squared error) ในการคำนวณด้วย scikit-learn ให้ใช้ฟังก์ชัน mean_squared_error() จากโมดูล sklearn.metrics แล้วนำผลลัพธ์ไปหารากที่สองด้วย numpy
ชุดข้อมูล movies ถูกโหลดและแบ่งเป็นชุด train และ test ให้แล้ว นอกจากนี้ค่าที่หายไปได้ถูกแทนที่ด้วยศูนย์ และฟีเจอร์ input ได้รับการทำ standardization ด้วย StandardScaler() หากต้องการเรียนรู้เพิ่มเติมเกี่ยวกับการ preprocessing สำหรับ machine learning ลองดูคอร์สของ DataCamp เรื่องการทำความสะอาดข้อมูลและ feature engineering ได้เลย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Ensemble Methods ใน Python
คำแนะนำการฝึกหัด
- สร้าง instance ของโมเดล
LinearRegressionแบบค่าเริ่มต้น - คำนวณค่าพยากรณ์บนชุด test
- คำนวณค่า RMSE โดยฟังก์ชัน
mean_squared_error()ต้องการอาร์กิวเมนต์ 2 ตัว ได้แก่y_testและค่าพยากรณ์ตามลำดับ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Build and fit linear regression model
reg_lm = ____
reg_lm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance using the RMSE
rmse = np.sqrt(____)
print('RMSE: {:.3f}'.format(rmse))