Klasyfikacja tekstu z użyciem wektorów tf/idf
Po przekształceniu kolumny title ze zbioru danych volunteer w wektory tf/idf, użyjesz tych wektorów do przewidywania wartości w kolumnie category_desc.
To ćwiczenie jest częścią kursu
Preprocessing w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Podziel wektor
text_tfidfi zmienną docelowąyna zbiory treningowy i testowy, ustawiając parametrstratifyrównyy– rozkład klas jest nierównomierny. Zwróć uwagę, że na wektorze tf/idf trzeba wywołać metodę.toarray(), aby uzyskać format wymagany przez scikit-learn. - Dopasuj dane
X_trainiy_traindo modelu Naive Bayesnb. - Wyświetl dokładność modelu na zbiorze testowym.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)
# Fit the model to the training data
nb.____(____, ____)
# Print out the model's accuracy
print(nb.____(____, ____))