शुरू करेंमुफ़्त में शुरू करें

GBM के साथ सेंटिमेंट एनालिसिस

आइए अब scikit-learn के GradientBoostingClassifier का उपयोग reviews डेटासेट पर करें ताकि किसी रिव्यू के टेक्स्ट के आधार पर उसका सेंटिमेंट प्रेडिक्ट किया जा सके.

हम कच्चे टेक्स्ट को मॉडल में इनपुट के रूप में पास नहीं करेंगे. आपके लिए निम्न प्री-प्रोसेसिंग की गई है:

  1. जिन रिव्यूज़ में वैल्यूज़ मिसिंग थीं, उन्हें हटा दिया गया है.
  2. टॉप 5 ऐप्स का डेटा चुना गया है.
  3. 500 रिव्यूज़ का एक रैंडम सबसैंपल चुना गया है.
  4. रिव्यूज़ से "stop words" हटा दिए गए हैं.
  5. रिव्यूज़ को एक मैट्रिक्स में बदला गया है, जहाँ हर फीचर किसी रिव्यू में किसी शब्द की आवृत्ति (frequency) को दर्शाता है.

क्या आप टेक्स्ट माइनिंग को और गहराई से समझना चाहते हैं? तो यह कोर्स देखें: Introduction to Natural Language Processing in Python!

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Ensemble Methods

पाठ्यक्रम देखें

अभ्यास निर्देश

  • 100 estimators और 0.1 learning rate के साथ एक GradientBoostingClassifier बनाइए.
  • टेस्ट सेट पर प्रेडिक्शंस कैलकुलेट करें.
  • मॉडल का मूल्यांकन करने के लिए accuracy कंप्यूट करें.
  • confusion matrix कैलकुलेट करें और प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
कोड संपादित करें और चलाएँ