शुरू करेंमुफ़्त में शुरू करें

मूवी टैगलाइन के लिए n-gram मॉडल

इस अभ्यास में, आपको 9000 से अधिक मूवी टैगलाइनों का corpus दिया गया है। आपका काम n-gram मॉडल बनाना है: n=1 तक, n=2 तक, और n=3 तक, और हर मॉडल के लिए फीचर्स की संख्या पता करना है.

इसके बाद हम हर मॉडल के लिए बनी फीचर्स की संख्या की तुलना करेंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में NLP के लिए Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • n=1 तक n-grams वाला n-gram मॉडल बनाएँ. इसका नाम ng1 रखें
  • n=2 तक n-grams वाला n-gram मॉडल बनाएँ. इसका नाम ng2 रखें
  • n=3 तक n-grams वाला n-gram मॉडल बनाएँ. इसका नाम ng3 रखें
  • हर मॉडल के लिए फीचर्स की संख्या प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)

# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)

# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)

# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))
कोड संपादित करें और चलाएँ