Textová klasifikace pomocí tf/idf vektorů
Teď, když máš sloupec title z datasetu volunteer zakódovaný do tf/idf vektorů, použiješ tyto vektory k predikci sloupce category_desc.
Toto cvičení je součástí kurzu
Preprocessing pro Machine Learning v Pythonu
Pokyny k cvičení
- Rozděl vektor
text_tfidfa cílovou proměnnouyna trénovací a testovací sadu — nastav parametrstratifynay, protože rozložení tříd je nerovnoměrné. Nezapomeň, že na tf/idf vektor je potřeba zavolat metodu.toarray(), aby měl správný formát pro scikit-learn. - Natrénuj model Naive Bayes
nbna datechX_trainay_train. - Vypiš přesnost modelu na testovací sadě.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)
# Fit the model to the training data
nb.____(____, ____)
# Print out the model's accuracy
print(nb.____(____, ____))