Bắt đầu ngayBắt đầu miễn phí

Pipeline đầu tiên của bạn - lần nữa!

Quay lại startup về rối loạn nhịp tim, buổi đánh giá hằng tháng của bạn sắp đến, và sẽ có một lập trình viên Python chuyên gia xem xét mã của bạn. Bạn quyết định dọn dẹp theo thực hành tốt nhất và thay thế script chọn đặc trưng và phân loại random forest bằng một pipeline. Bạn đang dùng bộ dữ liệu huấn luyện có sẵn là X_trainy_train, cùng một số mô-đun: RandomForestClassifier, SelectKBest()f_classif() để chọn đặc trưng, cũng như GridSearchCVPipeline.

Bài tập này là một phần của khóa học

Thiết kế quy trình Machine Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Tạo một pipeline với bộ chọn đặc trưng như trong mã mẫu và một bộ phân loại random forest. Đặt tên bước đầu tiên là feature_selection.
  • Thêm hai cặp khóa-giá trị trong params: một cho số lượng đặc trưng k trong bộ chọn với các giá trị 10 và 20, và một cho n_estimators trong rừng với các giá trị có thể là 2 và 5.
  • Khởi tạo một đối tượng GridSearchCV với pipeline và lưới tham số đã cho.
  • Fit đối tượng vào dữ liệu và in ra tổ hợp tham số có hiệu năng tốt nhất.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create pipeline with feature selector and classifier
pipe = ___([
    (___, SelectKBest(f_classif)),
    ('clf', ___(random_state=2))])

# Create a parameter grid
params = {
   'feature_selection__k':___,
    ___:[2, 5]}

# Initialize the grid search object
grid_search = ___(___, ___=params)

# Fit it to the data and print the best value combination
print(grid_search.fit(___, ___).___)
Chỉnh sửa và Chạy Mã