Bygg enkla logistiska regressionsmodeller
Datamängden donors innehåller 93 462 exempel på personer som fick ett insamlingsbrev för skadade militärveteraner. Kolumnen donated är 1 om personen skänkte en gåva som svar på brevet, och 0 annars. Detta binära utfall kommer att vara den beroende variabeln i den logistiska regressionsmodellen.
Övriga kolumner är egenskaper hos de potentiella givarna som kan påverka deras donationsbeteende. Dessa utgör modellens oberoende variabler.
När du bygger en regressionsmodell är det ofta hjälpsamt att formulera en hypotes om vilka oberoende variabler som kan vara prediktiva för den beroende variabeln. Kolumnen bad_address, som är satt till 1 för en ogiltig postadress och 0 annars, verkar kunna minska sannolikheten för en donation. På liknande sätt kan man anta att religiöst intresse (interest_religion) och intresse för veteranfrågor (interest_veterans) skulle vara förknippade med större välgörenhetsgivande.
I den här övningen använder du dessa tre faktorer för att skapa en enkel modell av donationsbeteende. Datamängden donors finns tillgänglig för dig att använda.
Den här övningen är en del av kursen
Övervakat lärande i R: Klassificering
Övningsinstruktioner
- Undersök
donorsmed funktionenstr(). - Räkna antalet förekomster av varje nivå i variabeln
donatedmed funktionentable(). - Anpassa en logistisk regressionsmodell med formelgränssnittet och de tre oberoende variabler som beskrivs ovan.
- Anropa
glm()med formeln som första argument och dataramen somdata-argument. - Spara resultatet som
donation_model.
- Anropa
- Sammanfatta modellobjektet med
summary().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Examine the dataset to identify potential independent variables
# Explore the dependent variable
# Build the donation model
donation_model <- glm(___,
data = ___, family = "___")
# Summarize the model results