ПочатиПочніть безкоштовно

Класифікація тексту з використанням векторів tf/idf

Тепер, коли ви закодували стовпець title у наборі даних volunteer у вектори tf/idf, використайте ці вектори, щоб передбачити стовпець category_desc.

Ця вправа є частиною курсу

Передобробка для машинного навчання в Python

Переглянути курс

Інструкції до вправи

  • Розбийте вектор text_tfidf і цільову змінну y на тренувальну та тестову вибірки, встановивши параметр stratify рівним y, оскільки розподіл класів нерівномірний. Зверніть увагу, що потрібно викликати метод .toarray() для вектора tf/idf, щоб отримати належний формат для scikit-learn.
  • Підженеріть (натренуйте) модель Наївного Байєса nb на даних X_train та y_train.
  • Виведіть точність на тестовій вибірці.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)

# Fit the model to the training data
nb.____(____, ____)

# Print out the model's accuracy
print(nb.____(____, ____))
Редагувати та запускати код