मूवी टैगलाइन के लिए n-gram मॉडल
इस अभ्यास में, आपको 9000 से अधिक मूवी टैगलाइनों का corpus दिया गया है। आपका काम n-gram मॉडल बनाना है: n=1 तक, n=2 तक, और n=3 तक, और हर मॉडल के लिए फीचर्स की संख्या पता करना है.
इसके बाद हम हर मॉडल के लिए बनी फीचर्स की संख्या की तुलना करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में NLP के लिए Feature Engineering
अभ्यास निर्देश
- n=1 तक n-grams वाला n-gram मॉडल बनाएँ. इसका नाम
ng1रखें - n=2 तक n-grams वाला n-gram मॉडल बनाएँ. इसका नाम
ng2रखें - n=3 तक n-grams वाला n-gram मॉडल बनाएँ. इसका नाम
ng3रखें - हर मॉडल के लिए फीचर्स की संख्या प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)
# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)
# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)
# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))