Twitter डेटा के performance metrics
आप एक logistic regression मॉडल ट्रेन करेंगे जो ट्वीट्स का sentiment प्रेडिक्ट करता है और अलग-अलग metrics का उपयोग करके टेस्ट सेट पर उसके performance का मूल्यांकन करेंगे.
आपके लिए एक मैट्रिक्स X बनाया गया है. इसमें text कॉलम पर BOW से बनाए गए फीचर्स शामिल हैं.
लेबल्स y नाम के वेक्टर में स्टोर हैं. वेक्टर y में negative ट्वीट्स के लिए 0, neutral के लिए 1, और positive के लिए 2 है.
ध्यान दें कि हालाँकि हमारे पास 3 क्लासेज हैं, यह अब भी एक classification समस्या है. Accuracy अब भी सही तरीके से प्रेडिक्ट हुए इंस्टेंसेज़ का अनुपात मापती है. Confusion matrix अब 3x3 साइज की होगी. हर row क्लास 2, 1, और 0 के लिए प्रेडिक्ट हुए केसेज़ की संख्या देगी, और हर column क्लास 2, 1, और 0 में true केसेज़ की संख्या दिखाएगा.
सभी आवश्यक पैकेज आपके लिए इम्पोर्ट कर दिए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Sentiment Analysis
अभ्यास निर्देश
- ट्रेन/टेस्ट स्प्लिट करें, और
yके आधार पर stratify करें. - एक logistic regression क्लासिफायर ट्रेन करें.
- टेस्ट सेट पर प्रेडिक्शन करें.
- टेस्ट सेट पर प्राप्त accuracy score और confusion matrix प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Split the data into training and testing sets
X_train, X_test, y_train, y_test = ____(X, y, test_size=0.3, random_state=123, ____=y)
# Train a logistic regression
log_reg = ____.____(___, ____)
# Make predictions on the test set
y_predicted = log_reg.____(___)
# Print the performance metrics
print('Accuracy score test set: ', ____(y_test, y_predicted))
print('Confusion matrix test set: \n', ____(y_test, y_predicted)/len(y_test))