НачатьНачать бесплатно

Классификация текста с помощью tf/idf-векторов

Теперь, когда вы преобразовали столбец title набора данных volunteer в tf/idf-векторы, используйте их для предсказания значений столбца category_desc.

Это упражнение является частью курса

Предобработка данных для машинного обучения на Python

Посмотреть курс

Инструкции к упражнению

  • Разделите вектор text_tfidf и целевую переменную y на обучающую и тестовую выборки, задав параметр stratify равным y, поскольку распределение классов неравномерно. Обратите внимание: перед подачей tf/idf-вектора в scikit-learn необходимо вызвать метод .toarray(), чтобы привести его к нужному формату.
  • Обучите модель наивного Байеса nb на данных X_train и y_train.
  • Выведите точность модели на тестовой выборке.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)

# Fit the model to the training data
nb.____(____, ____)

# Print out the model's accuracy
print(nb.____(____, ____))
Редактировать и запускать код