शुरू करेंमुफ़्त में शुरू करें

स्टेप 3: एक क्लासिफायर बनाना

यह सेंटिमेंट एनालिसिस प्रिडिक्शन का आख़िरी स्टेप है. हमने अपने डेटासेट को सेंटिमेंट-संबंधित फीचर्स से समृद्ध किया है और उनसे न्यूमेरिक वेक्टर बनाए हैं.

आप वही डेटासेट उपयोग करेंगे जो आपने पिछले स्टेप्स में तैयार किया था. विशेष रूप से, इसमें रिव्यू की लंबाई का एक फीचर है, और Tfidf वेक्टराइज़र से बने 200 फीचर्स हैं.

आपका कार्य सेंटिमेंट प्रिडिक्ट करने के लिए एक लॉजिस्टिक रिग्रेशन ट्रेन करना है. डेटा आपके लिए इम्पोर्ट किया जा चुका है और इसका नाम reviews_transformed है. टार्गेट score कहलाता है और बाइनरी है: प्रोडक्ट रिव्यू पॉज़िटिव हो तो 1, अन्यथा 0.

एक लॉजिस्टिक रिग्रेशन मॉडल ट्रेन कीजिए और टेस्ट डेटा पर उसका प्रदर्शन इवैल्यूएट कीजिए. मॉडल कितना अच्छा काम करता है?

सभी आवश्यक पैकेज आपके लिए इम्पोर्ट किए जा चुके हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Sentiment Analysis

पाठ्यक्रम देखें

अभ्यास निर्देश

  • train/test split कीजिए: डेटा का 20% टेस्टिंग के लिए रखें और random seed को 456 सेट करें.
  • एक लॉजिस्टिक रिग्रेशन मॉडल ट्रेन करें.
  • क्लास की प्रिडिक्शन करें.
  • टेस्ट सेट पर accuracy score और confusion matrix प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)

# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)

# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)

# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))
कोड संपादित करें और चलाएँ