Modelování datasetu UFO, část 2
Teď sestavíš model pomocí textového vektoru desc_tfidf a seznamu filtered_words, ze kterého vytvoříš filtrovaný textový vektor. Uvidíme, jestli se ti podaří na základě textu předpovědět type pozorování. Použiješ k tomu model Naive Bayes.
Toto cvičení je součástí kurzu
Preprocessing pro Machine Learning v Pythonu
Pokyny k cvičení
- Filtruj vektor
desc_tfidftak, že jako index předáš seznamfiltered_words. - Rozděl příznaky
filtered_textaya zajisti rovnoměrné rozložení tříd v trénovací i testovací sadě; použijrandom_states hodnotou42. - Pomocí metody
.fit()modelunbnatrénuj model na datechX_trainay_train. - Vypiš výsledek metody
.score()modelunbna sadáchX_testay_test.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Use the list of filtered words we created to filter the text vector
filtered_text = ____[:, list(____)]
# Split the X and y sets using train_test_split, setting stratify=y
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____, random_state=42)
# Fit nb to the training sets
____
# Print the score of nb on the test sets
____