Začněte nyníZačněte zdarma

Výběr ideální datové sady

Teď se zbavíme nepotřebných příznaků v datasetu ufo. Protože sloupec country byl zakódován jako country_enc, můžeš ho ponechat a odstranit ostatní sloupce související s polohou: city, country, lat, long a state.

Sloupce month a year jsi vytvořil/a ručně, takže sloupce date ani recorded už nepotřebuješ. Sloupec seconds jsi standardizoval/a jako seconds_log, takže seconds a minutes můžeš vypustit.

Sloupec desc byl vektorizován, takže ho lze odstranit. Sloupec type prozatím ponecháš.

Můžeš se také zbavit sloupce length_of_time, který je po extrakci minutes nadbytečný.

Toto cvičení je součástí kurzu

Preprocessing pro Machine Learning v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř seznam všech sloupců k odstranění — pojmenuj ho to_drop.
  • Tyto sloupce odstraň z ufo.
  • Použij funkci words_to_filter(), kterou jsi vytvořil/a dříve; předej jí vocab, vec.vocabulary_, desc_tfidf a jako poslední parametr zadej, že chceš ponechat top 4 slova.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Make a list of features to drop
to_drop = [____]

# Drop those features
ufo_dropped = ufo.____

# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)
Upravit a spustit kód