ÎncepețiÎncepe gratuit

Clasificarea textelor folosind vectori tf/idf

Acum că ai codificat coloana title din setul de date volunteer în vectori tf/idf, vei folosi acești vectori pentru a prezice coloana category_desc.

Acest exercițiu face parte din cursul

Preprocesare pentru Machine Learning în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Împarte vectorul text_tfidf și variabila țintă y în seturi de antrenament și de testare, setând parametrul stratify egal cu y, deoarece distribuția claselor este neuniformă. Reține că trebuie să aplici metoda .toarray() pe vectorul tf/idf, pentru a-l aduce în formatul corect pentru scikit-learn.
  • Antrenează modelul Naive Bayes nb pe datele X_train și y_train.
  • Afișează acuratețea pe setul de testare.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)

# Fit the model to the training data
nb.____(____, ____)

# Print out the model's accuracy
print(nb.____(____, ____))
Editează și rulează codul