शुरू करेंमुफ़्त में शुरू करें

स्टैक्ड बार चार्ट की तुलना और अंतर

अपने टेक्स्ट को समझने का एक और तरीका यह है कि देखें दस्तावेज़/दस्तावेज़ों में सकारात्मक और नकारात्मक शब्द कितने हैं। उदाहरण के लिए, किसी रेस्टोरेंट की समीक्षा में कुछ अच्छी बातें हो सकती हैं जैसे "the food was good" लेकिन आगे चलकर यह भी लिखा हो सकता है, "the restaurant was dirty, the staff was rude and parking was awful." नतीजतन, आप यह समझना चाहेंगे कि किसी दस्तावेज़ का कितना हिस्सा सकारात्मक भाषा और कितना नकारात्मक भाषा को समर्पित है। इस उदाहरण में सकारात्मक के मुकाबले नकारात्मक प्रतिशत अधिक होगा.

ऐसा करने का एक तरीका यह है कि सकारात्मक और नकारात्मक शब्दों को count() करें और फिर पहचाने गए subjectivity शब्दों की कुल संख्या से भाग दें। रेस्टोरेंट रिव्यू के उदाहरण में, "good" 1 सकारात्मक गिना जाएगा और "dirty," "rude," और "awful" 3 नकारात्मक शब्द माने जाएँगे। एक सरल गणना आपको दिखाती है कि 4 subjectivity शब्द होने के कारण यह समीक्षा 25% सकारात्मक और 75% नकारात्मक है.

शुरू करें inner_join() से, एक एकीकृत tidy डेटा फ्रेम पर जिसमें 4 किताबें हैं: Agamemnon, Oz, Huck Finn, और Moby Dick। ठीक पिछले अभ्यास की तरह आप filter() और grepl() का उपयोग करेंगे.

count() करने के लिए आपको डेटा को पहले किताब और फिर sentiment के आधार पर group करना होगा। उदाहरण के लिए Agamemnon के सभी सकारात्मक शब्दों को एक साथ group कर tally करना होगा ताकि सभी किताबों के सकारात्मक शब्द आपस में न मिल जाएँ। अच्छी बात यह है कि आप count() में सीधे कई वैरिएबल पास कर सकते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Sentiment Analysis

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Review tail of all_books
tail(all_books)

# Count by book & sentiment
books_sent_count <- all_books %>%
  # Inner join to nrc lexicon
  ___(___, by = c("term" = "word")) %>% 
  # Keep only positive or negative
  ___(__("___", sentiment)) %>% 
  # Count by book and by sentiment
  ___(___, ___)
  
# Review entire object
books_sent_count
कोड संपादित करें और चलाएँ