Bắt đầu ngayBắt đầu miễn phí

Lấy mẫu phân tầng

Giờ bạn đã biết rằng phân bố nhãn lớp trong cột category_desc của bộ dữ liệu volunteer là không đồng đều. Nếu bạn muốn huấn luyện một mô hình để dự đoán category_desc, bạn cần đảm bảo mô hình được huấn luyện trên một mẫu dữ liệu đại diện cho toàn bộ bộ dữ liệu. Lấy mẫu phân tầng là một cách để làm điều đó!

Bài tập này là một phần của khóa học

Tiền xử lý cho Machine Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Tạo DataFrame đặc trưng, X, gồm tất cả các cột trừ category_desc.
  • Tạo DataFrame nhãn, y, từ cột category_desc.
  • Chia Xy thành tập huấn luyện và kiểm tra, đảm bảo phân bố lớp trong nhãn giống nhau ở cả hai tập
  • In nhãn và số lượng trong y_train bằng .value_counts().

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create a DataFrame with all columns except category_desc
X = volunteer.____(____, axis=____)

# Create a category_desc labels dataset
y = ____[[____]]

# Use stratified sampling to split up the dataset according to the y dataset
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)

# Print the category_desc counts from y_train
print(____[____].____)
Chỉnh sửa và Chạy Mã