Clasificarea textelor folosind vectori tf/idf
Acum că ai codificat coloana title din setul de date volunteer în vectori tf/idf, vei folosi acești vectori pentru a prezice coloana category_desc.
Acest exercițiu face parte din cursul
Preprocesare pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Împarte vectorul
text_tfidfși variabila țintăyîn seturi de antrenament și de testare, setând parametrulstratifyegal cuy, deoarece distribuția claselor este neuniformă. Reține că trebuie să aplici metoda.toarray()pe vectorul tf/idf, pentru a-l aduce în formatul corect pentru scikit-learn. - Antrenează modelul Naive Bayes
nbpe dateleX_trainșiy_train. - Afișează acuratețea pe setul de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)
# Fit the model to the training data
nb.____(____, ____)
# Print out the model's accuracy
print(nb.____(____, ____))