or
यह अभ्यास पाठ्यक्रम का हिस्सा है
क्योंकि टेक्स्ट अनस्ट्रक्चर्ड डेटा होता है, उसे ऐसे रूप में लाने के लिए कुछ रैंगलिंग ज़रूरी है जहाँ आप उसका विश्लेषण कर सकें। इस अध्याय में, आप टोकनाइज़िंग, क्लीनिंग, और टेक्स्ट को कैटेगॉरिकल डेटा की तरह ट्रीट करके टेक्स्ट में स्ट्रक्चर जोड़ना सीखेंगे।
काउंट्स उपयोगी हैं, लेकिन विज़ुअलाइज़ेशन और भी बेहतर होते हैं। इस अध्याय में, आप सीखेंगे कि ggplot2 से जो आप जानते हैं उसे tidy टेक्स्ट डेटा पर कैसे लागू करें।
शब्द-गणना और विज़ुअलाइज़ेशन कंटेंट के बारे में कुछ संकेत देते हैं, लेकिन हम इससे आगे जा सकते हैं। इस अध्याय में, हम केवल शब्द-गणना से आगे बढ़कर टेक्स्ट के सेंटिमेंट या भावात्मक वैलेंस का विश्लेषण करेंगे।
इस अंतिम अध्याय में, हम शब्द-गणना से आगे बढ़कर दस्तावेज़ों के संग्रह में छिपे हुए टॉपिक्स खोजेंगे। हम एक मानक टॉपिक मॉडल का उपयोग करेंगे जिसे latent Dirichlet allocation कहा जाता है।
वर्तमान अभ्यास