Polarity आधारित कॉर्पस बनाएँ
इस अभ्यास में आप text mining workflow का Step 3 करेंगे। हालाँकि qdap एक tidy पैकेज नहीं है, आप लौटाई गई polarity लिस्ट के आधार पर एक नया कॉलम mutate() से जोड़ेंगे जो सभी polarity (यही BTW संकेत है) स्कोर दर्शाता है। Chapter 3 में हमने एक कस्टम फंक्शन pol_subsections इस्तेमाल किया था जो केवल base R डिक्लेरेशनों का उपयोग करता है। लेकिन tidy principles का पालन करते हुए, यह अभ्यास पहले filter() का प्रयोग करता है और फिर pull() से परिचय कराता है। pull() फंक्शन [[ की तरह एक single वैरिएबल निकालता है.
एक बार अलग करने के बाद, आप सभी positive और negative कमेंट्स को जोड़कर दो बड़े डॉक्यूमेंट्स बनाएँगे, जो positive और negative रेंटल रिव्यूज़ के सभी शब्दों का प्रतिनिधित्व करेंगे.
अंत में, आप Term Frequency Inverse Document Frequency (TFIDF) वेटेड Term Document Matrix (TDM) बनाएँगे। क्योंकि इस अभ्यास का कोड tidy स्ट्रक्चर से शुरू होता है, इसलिए स्टाइल एक जैसा रखने के लिए tm से कुछ फंक्शंस को %>% ऑपरेटर के साथ लिया गया है। अगर tm पैकेज की बुनियाद आपको परिचित नहीं है, तो Text Mining with Bag-of-Words in R कोर्स देखें। किसी शब्द के इस्तेमाल की गिनती (frequency) करने के बजाय, TDM के मानों को ज़्यादा इस्तेमाल होने वाले terms के लिए दंडित किया जाता है, जिससे non-informative शब्द कम हो जाते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Sentiment Analysis
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
pos_terms <- bos_reviews %>%
# Add polarity column
___(polarity = ___) %>%
# Filter for positive polarity
___(___) %>%
# Extract comments column
___(___) %>%
# Paste and collapse
___(collapse = "___")