Класифікація тексту з використанням векторів tf/idf
Тепер, коли ви закодували стовпець title у наборі даних volunteer у вектори tf/idf, використайте ці вектори, щоб передбачити стовпець category_desc.
Ця вправа є частиною курсу
Передобробка для машинного навчання в Python
Інструкції до вправи
- Розбийте вектор
text_tfidfі цільову зміннуyна тренувальну та тестову вибірки, встановивши параметрstratifyрівнимy, оскільки розподіл класів нерівномірний. Зверніть увагу, що потрібно викликати метод.toarray()для вектора tf/idf, щоб отримати належний формат для scikit-learn. - Підженеріть (натренуйте) модель Наївного Байєса
nbна данихX_trainтаy_train. - Виведіть точність на тестовій вибірці.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)
# Fit the model to the training data
nb.____(____, ____)
# Print out the model's accuracy
print(nb.____(____, ____))