GBM के साथ सेंटिमेंट एनालिसिस
आइए अब scikit-learn के GradientBoostingClassifier का उपयोग reviews डेटासेट पर करें ताकि किसी रिव्यू के टेक्स्ट के आधार पर उसका सेंटिमेंट प्रेडिक्ट किया जा सके.
हम कच्चे टेक्स्ट को मॉडल में इनपुट के रूप में पास नहीं करेंगे. आपके लिए निम्न प्री-प्रोसेसिंग की गई है:
- जिन रिव्यूज़ में वैल्यूज़ मिसिंग थीं, उन्हें हटा दिया गया है.
- टॉप 5 ऐप्स का डेटा चुना गया है.
- 500 रिव्यूज़ का एक रैंडम सबसैंपल चुना गया है.
- रिव्यूज़ से "stop words" हटा दिए गए हैं.
- रिव्यूज़ को एक मैट्रिक्स में बदला गया है, जहाँ हर फीचर किसी रिव्यू में किसी शब्द की आवृत्ति (frequency) को दर्शाता है.
क्या आप टेक्स्ट माइनिंग को और गहराई से समझना चाहते हैं? तो यह कोर्स देखें: Introduction to Natural Language Processing in Python!
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Ensemble Methods
अभ्यास निर्देश
100estimators और0.1learning rate के साथ एकGradientBoostingClassifierबनाइए.- टेस्ट सेट पर प्रेडिक्शंस कैलकुलेट करें.
- मॉडल का मूल्यांकन करने के लिए accuracy कंप्यूट करें.
- confusion matrix कैलकुलेट करें और प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)