शुरू करेंमुफ़्त में शुरू करें

Normalization के बिना मॉडलिंग

आइए देखें कि अगर आप बिना किसी तरह की standardization किए सीधे मॉडलिंग करें, तो आपके मॉडल की accuracy पर क्या असर पड़ सकता है।

यहाँ हमारे पास wine डेटासेट का एक subset है। इसकी एक कॉलम, Proline, की variance बाकी कॉलम्स की तुलना में बहुत अधिक है। यह वह स्थिति है जहाँ log normalization जैसी तकनीक काम आती है। आप इसके बारे में अगले सेक्शन में सीखेंगे।

इस चरण तक scikit-learn का मॉडल ट्रेनिंग प्रोसेस आप के लिए परिचित होना चाहिए, इसलिए हम इसमें बहुत गहराई में नहीं जाएँगे। आपके पास पहले से एक k-nearest neighbors मॉडल (knn) उपलब्ध है, साथ ही X और y सेट्स भी हैं जिन पर आपको fit और score करना है।

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Machine Learning के लिए Preprocessing

पाठ्यक्रम देखें

अभ्यास निर्देश

  • X और y सेट्स को training और test सेट्स में बाँटें, और सुनिश्चित करें कि दोनों सेट्स में class labels समान रूप से वितरित हों।
  • knn मॉडल को training फीचर्स और लेबल्स पर fit करें।
  • .score() मेथड का उपयोग करके knn मॉडल की test सेट accuracy प्रिंट करें।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Split the dataset into training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, stratify=____, random_state=42)

knn = KNeighborsClassifier()

# Fit the knn model to the training data
knn.____(____, ____)

# Score the model on the test data
print(knn.____(____))
कोड संपादित करें और चलाएँ