Začněte nyníZačněte zdarma

Textová klasifikace pomocí tf/idf vektorů

Teď, když máš sloupec title z datasetu volunteer zakódovaný do tf/idf vektorů, použiješ tyto vektory k predikci sloupce category_desc.

Toto cvičení je součástí kurzu

Preprocessing pro Machine Learning v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Rozděl vektor text_tfidf a cílovou proměnnou y na trénovací a testovací sadu — nastav parametr stratify na y, protože rozložení tříd je nerovnoměrné. Nezapomeň, že na tf/idf vektor je potřeba zavolat metodu .toarray(), aby měl správný formát pro scikit-learn.
  • Natrénuj model Naive Bayes nb na datech X_train a y_train.
  • Vypiš přesnost modelu na testovací sadě.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)

# Fit the model to the training data
nb.____(____, ____)

# Print out the model's accuracy
print(nb.____(____, ____))
Upravit a spustit kód