การสร้างโมเดล Logistic Regression อย่างง่าย
ชุดข้อมูล donors ประกอบด้วยตัวอย่าง 93,462 รายการของผู้ที่ได้รับจดหมายชักชวนบริจาคเพื่อช่วยเหลือทหารผ่านศึกที่พิการ คอลัมน์ donated มีค่าเป็น 1 หากบุคคลนั้นบริจาคเงินเพื่อตอบสนองต่อจดหมาย และ 0 หากไม่ได้บริจาค ผลลัพธ์แบบ binary นี้จะเป็น ตัวแปรตาม (dependent variable) ของโมเดล logistic regression
คอลัมน์ที่เหลือคือคุณลักษณะของผู้บริจาคที่อาจส่งผลต่อพฤติกรรมการบริจาค ซึ่งถือเป็น ตัวแปรอิสระ (independent variables) ของโมเดล
ในการสร้างโมเดล regression การตั้งสมมติฐานล่วงหน้าว่าตัวแปรอิสระใดจะช่วยทำนายตัวแปรตามได้นั้นเป็นสิ่งที่มีประโยชน์มาก คอลัมน์ bad_address ซึ่งมีค่า 1 สำหรับที่อยู่ไม่ถูกต้องและ 0 สำหรับที่อยู่ที่ถูกต้อง น่าจะส่งผลให้โอกาสการบริจาคลดลง ในทำนองเดียวกัน ความสนใจด้านศาสนา (interest_religion) และความสนใจด้านกิจการทหารผ่านศึก (interest_veterans) น่าจะมีความสัมพันธ์กับการบริจาคการกุศลที่มากขึ้น
ในแบบฝึกหัดนี้ คุณจะใช้ปัจจัยทั้งสามนี้เพื่อสร้างโมเดลพฤติกรรมการบริจาคอย่างง่าย โดยชุดข้อมูล donors พร้อมให้ใช้งานแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Supervised Learning in R: Classification
คำแนะนำการฝึกหัด
- ตรวจสอบ
donorsโดยใช้ฟังก์ชันstr() - นับจำนวนครั้งที่แต่ละระดับของตัวแปร
donatedปรากฏ โดยใช้ฟังก์ชันtable() - Fit โมเดล logistic regression โดยใช้ formula interface กับตัวแปรอิสระทั้งสามตัวที่กล่าวถึงข้างต้น
- เรียก
glm()โดยส่ง formula เป็นอาร์กิวเมนต์แรก และ data frame เป็นอาร์กิวเมนต์data - บันทึกผลลัพธ์ไว้ในตัวแปรชื่อ
donation_model
- เรียก
- สรุปออบเจกต์โมเดลด้วย
summary()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Examine the dataset to identify potential independent variables
# Explore the dependent variable
# Build the donation model
donation_model <- glm(___,
data = ___, family = "___")
# Summarize the model results