Lấy mẫu phân tầng
Giờ bạn đã biết rằng phân bố nhãn lớp trong cột category_desc của bộ dữ liệu volunteer là không đồng đều. Nếu bạn muốn huấn luyện một mô hình để dự đoán category_desc, bạn cần đảm bảo mô hình được huấn luyện trên một mẫu dữ liệu đại diện cho toàn bộ bộ dữ liệu. Lấy mẫu phân tầng là một cách để làm điều đó!
Bài tập này là một phần của khóa học
Tiền xử lý cho Machine Learning bằng Python
Hướng dẫn bài tập
- Tạo DataFrame đặc trưng,
X, gồm tất cả các cột trừcategory_desc. - Tạo DataFrame nhãn,
y, từ cộtcategory_desc. - Chia
Xvàythành tập huấn luyện và kiểm tra, đảm bảo phân bố lớp trong nhãn giống nhau ở cả hai tập - In nhãn và số lượng trong
y_trainbằng.value_counts().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a DataFrame with all columns except category_desc
X = volunteer.____(____, axis=____)
# Create a category_desc labels dataset
y = ____[[____]]
# Use stratified sampling to split up the dataset according to the y dataset
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)
# Print the category_desc counts from y_train
print(____[____].____)