शुरू करेंमुफ़्त में शुरू करें

अनदेखे डेटा को ट्रांसफॉर्म करना

टेक्स्ट से वेक्टर बनाते समय, जो भी ट्रांसफ़ॉर्मेशन आप मशीन लर्निंग मॉडल को train करने से पहले करते हैं, वही ट्रांसफ़ॉर्मेशन आपको नए, अनदेखे (test) डेटा पर भी लागू करने होते हैं. इसे करने के लिए पिछले चैप्टर वाला ही तरीका अपनाएँ: वेक्टराइज़र को केवल training डेटा पर fit करें, और उसे test डेटा पर apply करें.

इस अभ्यास के लिए speech_df DataFrame को दो भागों में बाँटा गया है:

  • train_speech_df: पहले 45 भाषणों वाला training सेट.
  • test_speech_df: शेष भाषणों वाला test सेट.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में मशीन लर्निंग के लिए फीचर इंजीनियरिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • TfidfVectorizer को instantiate करें.
  • वेक्टराइज़र को fit करें और उसे text_clean कॉलम पर apply करें.
  • इसी वेक्टराइज़र को test डेटा के text_clean कॉलम पर भी apply करें.
  • Test सेट से प्राप्त इन नए फीचर्स का एक DataFrame बनाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')

# Fit the vectroizer and transform the data
tv_transformed = ____

# Transform test data
test_tv_transformed = ____

# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____, 
                          columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())
कोड संपादित करें और चलाएँ