НачатьНачать бесплатно

Масштабирование и центрирование для классификации

Теперь вы объедините масштабирование и построение модели в единый пайплайн для кросс-валидации.

Ваша задача — построить пайплайн для масштабирования признаков в наборе данных music_df и выполнить поиск по сетке с кросс-валидацией, используя модель логистической регрессии с различными значениями гиперпараметра C. Целевая переменная — "genre", которая содержит бинарные значения: 1 для рока и 0 для любого другого жанра.

StandardScaler, LogisticRegression и GridSearchCV уже импортированы.

Это упражнение является частью курса

Обучение с учителем с помощью scikit-learn

Посмотреть курс

Инструкции к упражнению

  • Определите шаги пайплайна: объект StandardScaler() с именем "scaler" и модель логистической регрессии с именем "logreg".
  • Создайте parameters, задав 20 равномерно распределённых значений с плавающей точкой в диапазоне от 0.001 до 1.0 для гиперпараметра C модели логистической регрессии внутри пайплайна.
  • Создайте экземпляр объекта поиска по сетке.
  • Обучите объект поиска по сетке на обучающих данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Build the steps
steps = [("____", ____()),
         ("____", ____())]
pipeline = Pipeline(steps)

# Create the parameter space
parameters = {"____": np.____(____, ____, 20)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, 
                                                    random_state=21)

# Instantiate the grid search object
cv = ____(____, param_grid=____)

# Fit to the training data
cv.____(____, ____)
print(cv.best_score_, "\n", cv.best_params_)
Редактировать и запускать код