Cross-validation cho R-squared
Cross-validation là một cách tiếp cận quan trọng để đánh giá mô hình. Nó tối đa hóa lượng dữ liệu mà mô hình có thể sử dụng, vì mô hình không chỉ được huấn luyện mà còn được kiểm tra trên toàn bộ dữ liệu hiện có.
Trong bài tập này, bạn sẽ xây dựng một mô hình hồi quy tuyến tính, sau đó dùng cross-validation 6-fold để đánh giá độ chính xác khi dự đoán doanh số dựa trên chi tiêu quảng cáo trên mạng xã hội. Bạn sẽ hiển thị điểm số riêng lẻ cho từng fold trong sáu fold.
Bộ dữ liệu sales_df đã được tách sẵn thành y (biến mục tiêu) và X (các đặc trưng), và đã được tải sẵn cho bạn. LinearRegression đã được import từ sklearn.linear_model.
Bài tập này là một phần của khóa học
Học có giám sát với scikit-learn
Hướng dẫn bài tập
- Import
KFoldvàcross_val_score. - Tạo
kfbằng cách gọiKFold(), đặt số lần chia là 6,shufflelàTrue, và đặt seed là5. - Thực hiện cross-validation dùng
regtrênXvày, truyềnkfvàocv. - In
cv_scores.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the necessary modules
from ____.____ import ____, ____
# Create a KFold object
kf = ____(n_splits=____, shuffle=____, random_state=____)
reg = LinearRegression()
# Compute 6-fold cross-validation scores
cv_scores = ____(____, ____, ____, cv=____)
# Print scores
print(____)