Bắt đầu ngayBắt đầu miễn phí

Chia dữ liệu nhân viên

Overfitting là vấn đề phổ biến trong phân tích. Điều này xảy ra khi một mô hình hoạt động tốt trên chính tập dữ liệu nó được phát triển, nhưng không khái quát hóa tốt ra ngoài tập đó.

Ta thực hiện train/test split để đảm bảo khả năng khái quát của mô hình: bạn phát triển mô hình trên tập huấn luyện và thử nghiệm nó trên tập kiểm tra sau đó.

Trong bài tập này, bạn sẽ chia cả targetfeatures thành tập huấn luyện và tập kiểm tra với tỷ lệ lần lượt là 75%/25%.

Bài tập này là một phần của khóa học

Phân tích Nhân sự (HR Analytics): Dự đoán nghỉ việc bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Import train_test_split từ module sklearn.model_selection
  • Dùng train_test_split() để chia tập dữ liệu của bạn thành tập huấn luyện và tập kiểm tra
  • Gán 25% quan sát vào tập kiểm tra

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____

# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)
Chỉnh sửa và Chạy Mã