or
यह अभ्यास पाठ्यक्रम का हिस्सा है
शब्दों की संख्या, कैरेक्टर्स की संख्या, औसत शब्द-लंबाई और स्पेशल कैरेक्टर्स (जैसे Twitter हैशटैग्स और मेंशन्स) की संख्या जैसे बेसिक फीचर्स निकालना सीखें। आप रीडेबिलिटी स्कोर्स निकालना और किसी टेक्स्ट को समझने के लिए कितनी शिक्षा आवश्यक है, यह निर्धारित करना भी सीखेंगे।
इस चैप्टर में, आप टोकनाइज़ेशन और लेमाटाइज़ेशन के बारे में सीखेंगे। इसके बाद, आप spaCy लाइब्रेरी का उपयोग करके टेक्स्ट क्लीनिंग, पार्ट-ऑफ-स्पीच टैगिंग, और नेम्ड एंटिटी रिकग्निशन करना सीखेंगे। इन कॉन्सेप्ट्स में महारत हासिल करने के बाद, आप Gettysburg address को मशीन-फ्रेंडली बनाएँगे, फेक न्यूज़ में संज्ञा के उपयोग का विश्लेषण करेंगे, और TechCrunch आर्टिकल में उल्लिखित लोगों की पहचान करेंगे।
n-gram मॉडलिंग के बारे में जानें और इसका उपयोग करके मूवी रिव्यू पर सेंटिमेंट एनालिसिस करें।
दो वेक्टर्स के बीच tf-idf वेट्स और कॉसाइन सिमिलैरिटी स्कोर कैसे निकाले जाते हैं, यह सीखें। इन कॉन्सेप्ट्स का उपयोग करके आप एक मूवी और TED Talk रिकमेंडर बनाएँगे। अंत में, आप वर्ड एम्बेडिंग्स के बारे में भी सीखेंगे और वर्ड वेक्टर रिप्रेज़ेंटेशन्स का उपयोग करके विभिन्न Pink Floyd गानों के बीच सिमिलैरिटीज़ निकालेंगे।
वर्तमान अभ्यास