शुरू करेंमुफ़्त में शुरू करें

साफ़-सफ़ाई और गिनती

twitter_data में केवल वे एयरलाइन ट्वीट्स देखें जिन्हें शिकायत के रूप में वर्गीकृत किया गया है — इसके लिए stop words हटा दें.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Text Analysis परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • twitter_data के ट्वीट्स को टोकनाइज़ करें. टोकनाइज़ किए गए शब्दों वाली कॉलम का नाम word रखें.
  • टोकनाइज़ किए गए twitter_data से डिफ़ॉल्ट stop words हटा दें.
  • केवल शिकायतों को रखने के लिए फ़िल्टर करें.
  • टोकनाइज़ और साफ़ किए गए टेक्स्ट पर word counts निकालें और गिनती के आधार पर descending क्रम में arrange करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
कोड संपादित करें और चलाएँ