असंगतियाँ सुधारना
अब जब आपने पहचान लिया है कि dest_size में whitespace असंगतियाँ हैं और cleanliness में capitalization असंगतियाँ हैं, तो आप अपने पास उपलब्ध नए टूल्स का उपयोग करके sfo_survey में असंगत मानों को ठीक करेंगे, बजाय इसके कि डेटा पॉइंट्स को पूरी तरह हटा दें. अगर 5% से अधिक डेटा पॉइंट्स हटाने पड़ें, तो यह आपके डेटासेट में bias जोड़ सकता है.
dplyr और stringr लोड हैं और sfo_survey उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में डेटा क्लीनिंग
अभ्यास निर्देश
sfo_surveyमेंdest_size_trimmedनाम का एक कॉलम जोड़ें, जिसमेंdest_sizeकॉलम के मान हों और शुरुआती व आखिरी सभी whitespace हटाए गए हों.- एक और कॉलम
cleanliness_lowerजोड़ें, जिसमेंcleanlinessकॉलम के मान पूरी तरह lowercase में बदले हुए हों. dest_size_trimmedमें प्रत्येक श्रेणी के आवृत्तियों (occurrences) की गणना करें.cleanliness_lowerमें प्रत्येक श्रेणी के आवृत्तियों (occurrences) की गणना करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
# dest_size_trimmed: dest_size without whitespace
mutate(dest_size_trimmed = ___,
# cleanliness_lower: cleanliness converted to lowercase
cleanliness_lower = ___)
# Count values of dest_size_trimmed
sfo_survey %>%
___
# Count values of cleanliness_lower
sfo_survey %>%
___