दस्तावेज़ समूहों के लिए Treemaps
अक्सर आप लेखक, प्रोडक्ट या कंपनी जैसे समूहों में दस्तावेज़ों के साथ काम करेंगे। यह अभ्यास आपको टेक्स्ट के बारे में सीखने देता है, जबकि समूहों को एक कॉम्पैक्ट विज़ुअल में बनाए रखता है। उदाहरण के लिए, अगर ग्राहक रिव्यूज़ को प्रोडक्ट के हिसाब से ग्रुप किया गया हो, तो आप एक ही समय में रिव्यूज़ के कई आयामों को एक्सप्लोर करना चाहेंगे। पहले आप रिव्यूज़ की polarity() निकाल सकते हैं। एक और आयाम लंबाई हो सकती है। दस्तावेज़ की लंबाई भावनात्मक तीव्रता दिखा सकती है। अगर कोई ग्राहक छोटा सा "great shoes!" लिखता है, तो यह अंदाजा लगाया जा सकता है कि वह किसी लंबे, सकारात्मक रिव्यू की तुलना में कम उत्साहित है। आप रिव्यूज़ को प्रोडक्ट टाइप के हिसाब से भी ग्रुप करना चाहेंगे, जैसे महिलाओं, पुरुषों और बच्चों के जूते। एक treemap आपको इन सभी आयामों की जाँच करने देता है.
टेक्स्ट विश्लेषण में, एक treemap के भीतर हर छोटा बॉक्स एक दस्तावेज़ दर्शाता है, जैसे कोई ट्वीट। दस्तावेज़ों को किसी तरीके से ग्रुप किया जाता है, जैसे लेखक के आधार पर। हर बॉक्स का आकार किसी न्यूमेरिक वैल्यू से तय होता है, जैसे शब्दों या अक्षरों की संख्या। अलग-अलग रंग किसी sentiment स्कोर से तय होते हैं.
जब आप tibble को ऑर्गनाइज़ कर लेते हैं, तो आप विज़ुअल बनाने के लिए treemap() फंक्शन वाली treemap लाइब्रेरी का इस्तेमाल करेंगे। नीचे दिए गए कोड उदाहरण में डेटा, ग्रुपिंग वैरिएबल्स, साइज, कलर और अन्य एस्थेटिक्स घोषित किए गए हैं.
treemap(
data_frame,
index = c("group", "individual_document"),
vSize = "doc_length",
vColor = "avg_score",
type = "value",
title = "Sentiment Scores by Doc",
palette = c("red", "white", "green")
)
प्री-लोडेड all_books ऑब्जेक्ट में 4 Shakespeare, 3 Melville और 4 Twain किताबों का एक संयुक्त, tidy फॉर्मेट कॉर्पस है। Treemap के आधार पर आप पहचान सकेंगे कि कौन लंबे उपन्यास लिखता है, और लेखक का समग्र polarity क्या है, साथ ही अलग-अलग किताबों के लिए भी.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Sentiment Analysis
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
book_length <- all_books %>%
# Count number of words per book
___(___)
# Examine the results
book_length