Výběr ideální datové sady
Teď se zbavíme nepotřebných příznaků v datasetu ufo. Protože sloupec country byl zakódován jako country_enc, můžeš ho ponechat a odstranit ostatní sloupce související s polohou: city, country, lat, long a state.
Sloupce month a year jsi vytvořil/a ručně, takže sloupce date ani recorded už nepotřebuješ. Sloupec seconds jsi standardizoval/a jako seconds_log, takže seconds a minutes můžeš vypustit.
Sloupec desc byl vektorizován, takže ho lze odstranit. Sloupec type prozatím ponecháš.
Můžeš se také zbavit sloupce length_of_time, který je po extrakci minutes nadbytečný.
Toto cvičení je součástí kurzu
Preprocessing pro Machine Learning v Pythonu
Pokyny k cvičení
- Vytvoř seznam všech sloupců k odstranění — pojmenuj ho
to_drop. - Tyto sloupce odstraň z
ufo. - Použij funkci
words_to_filter(), kterou jsi vytvořil/a dříve; předej jívocab,vec.vocabulary_,desc_tfidfa jako poslední parametr zadej, že chceš ponechat top4slova.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)