Предсказания классификации
При валидации моделей важно знать не только итоговую метку класса, но и степень уверенности модели в предсказании. Например, при прогнозировании исхода игры обычно интересует не только победитель, но и насколько вероятна его победа.
| Вероятность | Предсказание | Значение |
|---|---|---|
| 0 < .50 | 0 | Первый игрок проигрывает |
| .50 + | 1 | Первый игрок выигрывает |
В этом упражнении вы познакомитесь с методами .predict() и .predict_proba() на примере набора данных tic_tac_toe. Первый метод возвращает предсказание о том, выиграет ли первый игрок, а второй — вероятность его победы. Используйте rfc в качестве модели случайного леса для классификации.
Это упражнение является частью курса
Валидация моделей на Python
Инструкции к упражнению
- Создайте два массива предсказаний: один с метками классов, другой — с прогнозируемыми вероятностями.
- Используйте метод
.value_counts()для pandas Series, чтобы вывести количество наблюдений, отнесённых к каждому классу. - Выведите первое наблюдение из
probability_predictions, чтобы увидеть, как структурированы вероятности.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Fit the rfc model.
rfc.fit(X_train, y_train)
# Create arrays of predictions
classification_predictions = rfc.____(X_test)
probability_predictions = rfc.____(X_test)
# Print out count of binary predictions
print(pd.Series(____).____())
# Print the first value from probability_predictions
print('The first predicted probabilities are: {}'.format(____[____]))