Моделювання без нормалізації
Подивімося, що може статися з точністю вашої моделі, якщо ви спробуєте моделювати дані без попередньої стандартизації.
Тут наведено підмножину набору даних wine. Одна з колонок, Proline, має надзвичайно велику дисперсію порівняно з іншими. Це приклад ситуації, де стане у пригоді логнормалізація, про яку ви дізнаєтеся в наступному розділі.
Процес навчання моделей у scikit-learn уже має бути вам знайомий, тож не заглиблюватимемося в деталі. У вас уже є модель k-ближчих сусідів (knn), а також множини X і y, необхідні для навчання та оцінювання.
Ця вправа є частиною курсу
Передобробка для машинного навчання в Python
Інструкції до вправи
- Розбийте множини
Xіyна тренувальну та тестову вибірки, забезпечивши рівномірний розподіл міток класів в обох вибірках. - Навчіть модель
knnна тренувальних ознаках і мітках. - Виведіть точність моделі
knnна тестовій вибірці за допомогою методу.score().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Split the dataset into training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, stratify=____, random_state=42)
knn = KNeighborsClassifier()
# Fit the knn model to the training data
knn.____(____, ____)
# Score the model on the test data
print(knn.____(____))