मिसिंग डेटा को संभालना
इस अभ्यास में, आप accounts डेटा के एक और वर्शन पर काम कर रहे हैं जिसमें cust_id और acct_amount, दोनों कॉलम में missing values हैं.
आप यह जानना चाहते हैं कि बैंक के पास कुल कितने यूनिक कस्टमर हैं, और कस्टमर के पास रखी गई औसत राशि कितनी है. आपको पता है कि जिन पंक्तियों में cust_id missing है, वे उपयोगी नहीं हैं, और औसतन, acct_amount आमतौर पर inv_amount का 5 गुना होता है.
इस अभ्यास में, आप cust_id missing वाली accounts की पंक्तियों को ड्रॉप करेंगे, और कुछ डोमेन नॉलेज का इस्तेमाल करते हुए inv_amount के missing values को इम्प्यूट करेंगे. dplyr और assertive लोड हैं और accounts उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में डेटा क्लीनिंग
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create accounts_clean
accounts_clean <- accounts %>%
# Filter to remove rows with missing cust_id
___
accounts_clean