Классификация текста с помощью tf/idf-векторов
Теперь, когда вы преобразовали столбец title набора данных volunteer в tf/idf-векторы, используйте их для предсказания значений столбца category_desc.
Это упражнение является частью курса
Предобработка данных для машинного обучения на Python
Инструкции к упражнению
- Разделите вектор
text_tfidfи целевую переменнуюyна обучающую и тестовую выборки, задав параметрstratifyравнымy, поскольку распределение классов неравномерно. Обратите внимание: перед подачей tf/idf-вектора в scikit-learn необходимо вызвать метод.toarray(), чтобы привести его к нужному формату. - Обучите модель наивного Байеса
nbна данныхX_trainиy_train. - Выведите точность модели на тестовой выборке.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)
# Fit the model to the training data
nb.____(____, ____)
# Print out the model's accuracy
print(nb.____(____, ____))