Zacznij terazZacznij za darmo

Klasyfikacja tekstu z użyciem wektorów tf/idf

Po przekształceniu kolumny title ze zbioru danych volunteer w wektory tf/idf, użyjesz tych wektorów do przewidywania wartości w kolumnie category_desc.

To ćwiczenie jest częścią kursu

Preprocessing w uczeniu maszynowym w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Podziel wektor text_tfidf i zmienną docelową y na zbiory treningowy i testowy, ustawiając parametr stratify równy y – rozkład klas jest nierównomierny. Zwróć uwagę, że na wektorze tf/idf trzeba wywołać metodę .toarray(), aby uzyskać format wymagany przez scikit-learn.
  • Dopasuj dane X_train i y_train do modelu Naive Bayes nb.
  • Wyświetl dokładność modelu na zbiorze testowym.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)

# Fit the model to the training data
nb.____(____, ____)

# Print out the model's accuracy
print(nb.____(____, ____))
Edytuj i uruchom kod