एयरलाइन ट्वीट्स डेटा
twitter_data डेटा फ्रेम में एयरलाइंस के 7,000 से अधिक ट्वीट्स हैं. इन ट्वीट्स को पहले ही complaint_label कॉलम में शिकायत (complaint) या गैर-शिकायत (non-complaint) के रूप में क्लासिफाई किया जा चुका है. आइए देखें कि इनमें से कितने ट्वीट्स शिकायतें हैं.
ध्यान रखें कि यह Twitter का वास्तविक डेटा है, इसलिए इसमें गाली-गलौज या आपत्तिजनक सामग्री होने का जोखिम रहता है (इस अभ्यास में, और उन सभी आगे के अभ्यासों में जहाँ वास्तविक Twitter डेटा उपयोग किया गया है).
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Text Analysis परिचय
अभ्यास निर्देश
tidyverseपैकेज लोड कीजिए.twitter_dataप्रिंट करके डेटा के आकार और सामग्री का अंदाज़ा लगाइए.twitter_dataको ऐसे फ़िल्टर कीजिए कि उसमें सिर्फ शिकायतें रहें. डेटा में कुल कितनी शिकायतें हैं?
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the tidyverse packages
___(___)
# Print twitter_data
___
# Print just the complaints in twitter_data
twitter_data %>%
___(___ == ___)