Bắt đầu ngayBắt đầu miễn phí

Chuẩn hóa tâm và tỉ lệ cho bài toán phân loại

Giờ bạn sẽ kết hợp bước scaling và xây dựng mô hình vào một pipeline để cross-validation.

Nhiệm vụ của bạn là xây dựng một pipeline để scale các đặc trưng trong tập dữ liệu music_df và thực hiện grid search cross-validation bằng mô hình logistic regression với các giá trị khác nhau cho siêu tham số C. Biến mục tiêu là "genre", trong đó gán nhãn nhị phân: rock là 1 và các thể loại khác là 0.

StandardScaler, LogisticRegression, và GridSearchCV đã được import sẵn cho bạn.

Bài tập này là một phần của khóa học

Học có giám sát với scikit-learn

Xem khóa học

Hướng dẫn bài tập

  • Xây dựng các bước cho pipeline: một đối tượng StandardScaler() có tên "scaler", và một mô hình logistic regression có tên "logreg".
  • Tạo parameters, tìm kiếm 20 giá trị float cách đều trong khoảng từ 0.001 đến 1.0 cho siêu tham số C của mô hình logistic regression trong pipeline.
  • Khởi tạo đối tượng grid search.
  • Fit đối tượng grid search với dữ liệu huấn luyện.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Build the steps
steps = [("____", ____()),
         ("____", ____())]
pipeline = Pipeline(steps)

# Create the parameter space
parameters = {"____": np.____(____, ____, 20)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, 
                                                    random_state=21)

# Instantiate the grid search object
cv = ____(____, param_grid=____)

# Fit to the training data
cv.____(____, ____)
print(cv.best_score_, "\n", cv.best_params_)
Chỉnh sửa và Chạy Mã