पूर्वानुमेय Missingness की तलाश
यदि डेटा पूरी तरह से रैंडम तरीके से गायब है, तो आप बाकी डेटा के आधार पर यह भविष्यवाणी नहीं कर पाएँगे कि कोई वैरिएबल कब गायब होगा। इसलिए, यदि आप missingness की भविष्यवाणी कर सकते हैं, तो डेटा पूरी तरह से रैंडम तरीके से गायब नहीं है। तो, आइए glm() फंक्शन का उपयोग करके एक लॉजिस्टिक रिग्रेशन फिट करें, जिसमें आप पहले बनाए गए mort वैरिएबल में affordability के आधार पर missingness देखें। यदि आपको missing डेटा में कोई संरचना नहीं मिलती — अर्थात् slope वैरिएबल्स महत्वपूर्ण नहीं हैं — तो इसका अर्थ यह नहीं है कि आपने सिद्ध कर दिया कि डेटा रैंडम तरीके से गायब है, लेकिन यह संभव प्रतीत होता है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Scalable Data Processing
अभ्यास निर्देश
- मॉर्गेज डेटा में
"borrower_race"के missing होने (9 के बराबर) का संकेत देने वाला एक वैरिएबल बनाएँ. "affordability"कॉलम का एक factor वैरिएबल बनाएँ.affordability_factorकोborrower_race_indपर रिग्रेस करें और उस परsummary()कॉल करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9
# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])
# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))