Построение простых моделей логистической регрессии
Набор данных donors содержит 93 462 записи о людях, которым была разослана просьба о пожертвовании в пользу ветеранов-инвалидов. Столбец donated принимает значение 1, если человек сделал пожертвование в ответ на рассылку, и 0 в противном случае. Этот бинарный результат будет зависимой переменной модели логистической регрессии.
Остальные столбцы — это признаки потенциальных доноров, которые могут влиять на их склонность к пожертвованиям. Они являются независимыми переменными модели.
При построении регрессионной модели полезно заранее сформулировать гипотезу о том, какие независимые переменные будут влиять на зависимую. Столбец bad_address, равный 1 при недействительном почтовом адресе и 0 в противном случае, по всей видимости, снижает вероятность пожертвования. Кроме того, можно предположить, что религиозные интересы (interest_religion) и интерес к делам ветеранов (interest_veterans) связаны с большей склонностью к благотворительности.
В этом упражнении вы воспользуетесь этими тремя факторами, чтобы построить простую модель поведения доноров. Набор данных donors уже доступен для работы.
Это упражнение является частью курса
Обучение с учителем в R: классификация
Инструкции к упражнению
- Изучите структуру
donorsс помощью функцииstr(). - Подсчитайте количество наблюдений для каждого значения переменной
donatedс помощью функцииtable(). - Обучите модель логистической регрессии, используя интерфейс формул с тремя независимыми переменными, описанными выше.
- Вызовите
glm(), передав формулу первым аргументом, а набор данных — в аргументdata. - Сохраните результат в переменную
donation_model.
- Вызовите
- Выведите сводную информацию о модели с помощью
summary().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Examine the dataset to identify potential independent variables
# Explore the dependent variable
# Build the donation model
donation_model <- glm(___,
data = ___, family = "___")
# Summarize the model results