शुरू करेंमुफ़्त में शुरू करें

असंगतियाँ सुधारना

अब जब आपने पहचान लिया है कि dest_size में whitespace असंगतियाँ हैं और cleanliness में capitalization असंगतियाँ हैं, तो आप अपने पास उपलब्ध नए टूल्स का उपयोग करके sfo_survey में असंगत मानों को ठीक करेंगे, बजाय इसके कि डेटा पॉइंट्स को पूरी तरह हटा दें. अगर 5% से अधिक डेटा पॉइंट्स हटाने पड़ें, तो यह आपके डेटासेट में bias जोड़ सकता है.

dplyr और stringr लोड हैं और sfo_survey उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sfo_survey में dest_size_trimmed नाम का एक कॉलम जोड़ें, जिसमें dest_size कॉलम के मान हों और शुरुआती व आखिरी सभी whitespace हटाए गए हों.
  • एक और कॉलम cleanliness_lower जोड़ें, जिसमें cleanliness कॉलम के मान पूरी तरह lowercase में बदले हुए हों.
  • dest_size_trimmed में प्रत्येक श्रेणी के आवृत्तियों (occurrences) की गणना करें.
  • cleanliness_lower में प्रत्येक श्रेणी के आवृत्तियों (occurrences) की गणना करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
  # dest_size_trimmed: dest_size without whitespace
  mutate(dest_size_trimmed = ___,
         # cleanliness_lower: cleanliness converted to lowercase
         cleanliness_lower = ___)

# Count values of dest_size_trimmed
sfo_survey %>%
  ___

# Count values of cleanliness_lower
sfo_survey %>%
  ___
कोड संपादित करें और चलाएँ