Missing डेटा को संभालना
कुछ संभावित दाताओं के age डेटा में missing मान हैं. दुर्भाग्य से, R किसी भी रिग्रेशन मॉडल को बनाते समय NA मानों वाले सभी केसों को हटा देता है.
एक उपाय यह है कि missing मानों को किसी अनुमानित मान से बदल दिया जाए, या उन्हें impute किया जाए. ऐसा करने के बाद, आप एक missing data इंडिकेटर भी बना सकते हैं ताकि यह मॉडल किया जा सके कि जिन केसों में missing डेटा है, वे बिना missing डेटा वाले केसों से किसी तरह अलग हो सकते हैं.
डेटा फ़्रेम donors आपके वर्कस्पेस में लोड है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Supervised Learning: Classification
अभ्यास निर्देश
- non-missing डेटा वाले संभावित दाताओं की औसत आयु जानने के लिए
donors$ageपरsummary()का उपयोग करें. - missing
ageवाले केसों के लिए औसत मान (2 दशमलव स्थान तक राउंड किया हुआ) इम्प्यूट करने के लिएifelse()और टेस्टis.na(donors$age)का उपयोग करें.NAमानों को भी अनदेखा करना न भूलें. - उसी टेस्ट का उपयोग करते हुए और एक और
ifelse()कॉल के साथmissing_ageनाम का एक बाइनरी डमी वैरिएबल बनाएँ, जो missing डेटा की उपस्थिति को दर्शाए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Find the average age among non-missing values
summary(___)
# Impute missing age values with the mean age
donors$imputed_age <- ifelse(___)
# Create missing value indicator for age
donors$missing_age <- ___