Chuẩn hóa tâm và tỉ lệ cho bài toán phân loại
Giờ bạn sẽ kết hợp bước scaling và xây dựng mô hình vào một pipeline để cross-validation.
Nhiệm vụ của bạn là xây dựng một pipeline để scale các đặc trưng trong tập dữ liệu music_df và thực hiện grid search cross-validation bằng mô hình logistic regression với các giá trị khác nhau cho siêu tham số C. Biến mục tiêu là "genre", trong đó gán nhãn nhị phân: rock là 1 và các thể loại khác là 0.
StandardScaler, LogisticRegression, và GridSearchCV đã được import sẵn cho bạn.
Bài tập này là một phần của khóa học
Học có giám sát với scikit-learn
Hướng dẫn bài tập
- Xây dựng các bước cho pipeline: một đối tượng
StandardScaler()có tên"scaler", và một mô hình logistic regression có tên"logreg". - Tạo
parameters, tìm kiếm 20 giá trị float cách đều trong khoảng từ0.001đến1.0cho siêu tham sốCcủa mô hình logistic regression trong pipeline. - Khởi tạo đối tượng grid search.
- Fit đối tượng grid search với dữ liệu huấn luyện.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Build the steps
steps = [("____", ____()),
("____", ____())]
pipeline = Pipeline(steps)
# Create the parameter space
parameters = {"____": np.____(____, ____, 20)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2,
random_state=21)
# Instantiate the grid search object
cv = ____(____, param_grid=____)
# Fit to the training data
cv.____(____, ____)
print(cv.best_score_, "\n", cv.best_params_)