शुरू करेंमुफ़्त में शुरू करें

Polarity आधारित कॉर्पस बनाएँ

इस अभ्यास में आप text mining workflow का Step 3 करेंगे। हालाँकि qdap एक tidy पैकेज नहीं है, आप लौटाई गई polarity लिस्ट के आधार पर एक नया कॉलम mutate() से जोड़ेंगे जो सभी polarity (यही BTW संकेत है) स्कोर दर्शाता है। Chapter 3 में हमने एक कस्टम फंक्शन pol_subsections इस्तेमाल किया था जो केवल base R डिक्लेरेशनों का उपयोग करता है। लेकिन tidy principles का पालन करते हुए, यह अभ्यास पहले filter() का प्रयोग करता है और फिर pull() से परिचय कराता है। pull() फंक्शन [[ की तरह एक single वैरिएबल निकालता है.

एक बार अलग करने के बाद, आप सभी positive और negative कमेंट्स को जोड़कर दो बड़े डॉक्यूमेंट्स बनाएँगे, जो positive और negative रेंटल रिव्यूज़ के सभी शब्दों का प्रतिनिधित्व करेंगे.

अंत में, आप Term Frequency Inverse Document Frequency (TFIDF) वेटेड Term Document Matrix (TDM) बनाएँगे। क्योंकि इस अभ्यास का कोड tidy स्ट्रक्चर से शुरू होता है, इसलिए स्टाइल एक जैसा रखने के लिए tm से कुछ फंक्शंस को %>% ऑपरेटर के साथ लिया गया है। अगर tm पैकेज की बुनियाद आपको परिचित नहीं है, तो Text Mining with Bag-of-Words in R कोर्स देखें। किसी शब्द के इस्तेमाल की गिनती (frequency) करने के बजाय, TDM के मानों को ज़्यादा इस्तेमाल होने वाले terms के लिए दंडित किया जाता है, जिससे non-informative शब्द कम हो जाते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Sentiment Analysis

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
कोड संपादित करें और चलाएँ