TM रिफ्रेशर (II)
अब आइए एक Document Term Matrix (DTM) बनाते हैं. DTM में:
- मैट्रिक्स की हर पंक्ति एक डॉक्यूमेंट को दर्शाती है.
- हर कॉलम एक यूनिक वर्ड टोकन होता है.
- मैट्रिक्स के मान किसी डॉक्यूमेंट के शब्द-उपयोग (frequency) को दर्शाते हैं.
DTM कई bag of words विश्लेषणों का आधार है. कोर्स में आगे आप संबंधित Term Document Matrix (TDM) का भी उपयोग करेंगे. यह उसका ट्रांसपोज़ होता है; अर्थात् कॉलम डॉक्यूमेंट्स होते हैं और पंक्तियाँ यूनिक वर्ड टोकन.
आपको कॉर्पस को क्लीन करने ( clean_corpus() का उपयोग करके) के बाद DTM बनाना चाहिए. इसके लिए कॉर्पस ऑब्जेक्ट पर DocumentTermMatrix() कॉल करें.
tm_dtm <- DocumentTermMatrix(tm_clean)
यदि आपको और डिटेल में रिफ्रेशर चाहिए, तो Text Mining with Bag-of-Words in R कोर्स देखें. उम्मीद है, इन दो अभ्यासों ने आपको आपके sentiment analysis सफर की अच्छी शुरुआत के लिए तैयार कर दिया होगा!
ध्यान दें: यह डेटा Twitter से वास्तविक है, इसलिए इसमें गाली-गलौज या आपत्तिजनक सामग्री होने का जोखिम रहता है (इस अभ्यास में, और आगे के उन अभ्यासों में भी जिनमें वास्तविक Twitter डेटा उपयोग होता है).
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Sentiment Analysis
अभ्यास निर्देश
हमने clean_text नाम का एक VCorpus() ऑब्जेक्ट बनाया है, जिसमें कॉफ़ी का ज़िक्र करते 1000 ट्वीट्स हैं. इन ट्वीट्स को ऊपर बताए गए प्रीप्रोसेसिंग स्टेप्स से क्लीन किया गया है और आपका लक्ष्य इससे DTM बनाना है.
clean_textकॉर्पस परDocumentTermMatrix()लागू करके term frequency वेटेड DTM बनाइए, और उसेtf_dtmनाम दीजिए.DocumentTermMatrix()ऑब्जेक्ट को एक साधारण मैट्रिक्स में बदलने के लिएas.matrix()का उपयोग कीजिए. नए ऑब्जेक्ट का नामtf_dtm_mरखिए.- मैट्रिक्स के आयाम जाँचने के लिए
dim()का उपयोग कीजिए. - मैट्रिक्स का एक सबसेट देखने के लिए स्क्वेयर ब्रैकेट इंडेक्सिंग का उपयोग कीजिए.
- पंक्तियाँ 16 से 20, और कॉलम 2975 से 2985 चुनिए
- शब्द "working" की frequency वैल्यू नोट कीजिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# clean_text is pre-defined
clean_text
# Create tf_dtm
tf_dtm <- ___
# Create tf_dtm_m
tf_dtm_m <- ___
# Dimensions of DTM matrix
___
# Subset part of tf_dtm_m for comparison
___[___, ___]