लेखक के प्रयास का आकलन
अक्सर लेखक तब ज्यादा शब्दों का उपयोग करते हैं जब वे अधिक भावुक होते हैं। उदाहरण के लिए, एक नाराज़ एयरलाइन यात्री, जितनी बुरी (अनुभूत) सेवा होगी, उतनी लंबी समीक्षा छोड़ सकता है। वहीं कम उत्तेजित यात्री को लंबी समीक्षा लिखने की ज़रूरत महसूस नहीं हो सकती। लंबी समीक्षाएँ समग्र सेंटिमेंट को बढ़ा सकती हैं क्योंकि जैसे-जैसे समीक्षा लंबी होती जाती है, उसमें स्वाभाविक रूप से अधिक सकारात्मक या नकारात्मक भाषा शामिल होती है। यह कोडिंग अभ्यास, प्रयास और सेंटिमेंट की जाँच करने में मदद करता है।
इस अभ्यास में आप प्रयास और सेंटिमेंट के बीच संबंध को विज़ुअलाइज़ करेंगे। याद करें कि आपके रेंटल रिव्यू वाले tibble में id है और हर पंक्ति में एक शब्द दर्शाया गया है। परिणामस्वरूप, id का एक साधारण count() हर समीक्षा में इस्तेमाल हुए शब्दों की संख्या को पकड़ लेगा। फिर आप इस सारांश को पॉज़िटिव और नेगेटिव डेटा से जॉइन करेंगे। अंततः आप एक स्कैटर प्लॉट बनाएँगे जो लेखक की समीक्षा-लंबाई और उसकी polarity के संबंध को विज़ुअलाइज़ करेगा।
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Sentiment Analysis
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Review tidy_reviews and pos_neg
tidy_reviews
pos_neg
pos_neg_pol <- tidy_reviews %>%
# Effort is measured as count by id
___(___) %>%
# Inner join to pos_neg
___(___) %>%
# Add polarity status
___(pol = ___(___, "___", "___"))
# Examine results
pos_neg_pol