शुरू करेंमुफ़्त में शुरू करें

Missing डेटा को संभालना

कुछ संभावित दाताओं के age डेटा में missing मान हैं. दुर्भाग्य से, R किसी भी रिग्रेशन मॉडल को बनाते समय NA मानों वाले सभी केसों को हटा देता है.

एक उपाय यह है कि missing मानों को किसी अनुमानित मान से बदल दिया जाए, या उन्हें impute किया जाए. ऐसा करने के बाद, आप एक missing data इंडिकेटर भी बना सकते हैं ताकि यह मॉडल किया जा सके कि जिन केसों में missing डेटा है, वे बिना missing डेटा वाले केसों से किसी तरह अलग हो सकते हैं.

डेटा फ़्रेम donors आपके वर्कस्पेस में लोड है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Supervised Learning: Classification

पाठ्यक्रम देखें

अभ्यास निर्देश

  • non-missing डेटा वाले संभावित दाताओं की औसत आयु जानने के लिए donors$age पर summary() का उपयोग करें.
  • missing age वाले केसों के लिए औसत मान (2 दशमलव स्थान तक राउंड किया हुआ) इम्प्यूट करने के लिए ifelse() और टेस्ट is.na(donors$age) का उपयोग करें. NA मानों को भी अनदेखा करना न भूलें.
  • उसी टेस्ट का उपयोग करते हुए और एक और ifelse() कॉल के साथ missing_age नाम का एक बाइनरी डमी वैरिएबल बनाएँ, जो missing डेटा की उपस्थिति को दर्शाए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Find the average age among non-missing values
summary(___)

# Impute missing age values with the mean age
donors$imputed_age <- ifelse(___)

# Create missing value indicator for age
donors$missing_age <- ___
कोड संपादित करें और चलाएँ