साफ़-सफ़ाई और गिनती
twitter_data में केवल वे एयरलाइन ट्वीट्स देखें जिन्हें शिकायत के रूप में वर्गीकृत किया गया है — इसके लिए stop words हटा दें.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Text Analysis परिचय
अभ्यास निर्देश
twitter_dataके ट्वीट्स को टोकनाइज़ करें. टोकनाइज़ किए गए शब्दों वाली कॉलम का नामwordरखें.- टोकनाइज़ किए गए
twitter_dataसे डिफ़ॉल्ट stop words हटा दें. - केवल शिकायतों को रखने के लिए फ़िल्टर करें.
- टोकनाइज़ और साफ़ किए गए टेक्स्ट पर word counts निकालें और गिनती के आधार पर descending क्रम में arrange करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)