Масштабирование и центрирование для классификации
Теперь вы объедините масштабирование и построение модели в единый пайплайн для кросс-валидации.
Ваша задача — построить пайплайн для масштабирования признаков в наборе данных music_df и выполнить поиск по сетке с кросс-валидацией, используя модель логистической регрессии с различными значениями гиперпараметра C. Целевая переменная — "genre", которая содержит бинарные значения: 1 для рока и 0 для любого другого жанра.
StandardScaler, LogisticRegression и GridSearchCV уже импортированы.
Это упражнение является частью курса
Обучение с учителем с помощью scikit-learn
Инструкции к упражнению
- Определите шаги пайплайна: объект
StandardScaler()с именем"scaler"и модель логистической регрессии с именем"logreg". - Создайте
parameters, задав 20 равномерно распределённых значений с плавающей точкой в диапазоне от0.001до1.0для гиперпараметраCмодели логистической регрессии внутри пайплайна. - Создайте экземпляр объекта поиска по сетке.
- Обучите объект поиска по сетке на обучающих данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Build the steps
steps = [("____", ____()),
("____", ____())]
pipeline = Pipeline(steps)
# Create the parameter space
parameters = {"____": np.____(____, ____, 20)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2,
random_state=21)
# Instantiate the grid search object
cv = ____(____, param_grid=____)
# Fit to the training data
cv.____(____, ____)
print(cv.best_score_, "\n", cv.best_params_)