Välj den optimala datamängden
Nu är det dags att ta bort några onödiga särdrag från datamängden ufo. Eftersom kolumnen country har kodats som country_enc kan du behålla den och ta bort de övriga platsrelaterade kolumnerna: city, country, lat, long och state.
Du har skapat kolumnerna month och year, så du behöver inte längre date eller recorded. Du har också standardiserat kolumnen seconds som seconds_log, vilket innebär att du kan ta bort seconds och minutes.
Du har vektoriserat desc, så den kan tas bort. Tills vidare behåller du type.
Du kan också ta bort kolumnen length_of_time, som är överflödig efter att du extraherat minutes.
Den här övningen är en del av kursen
Förbehandling för maskininlärning i Python
Övningsinstruktioner
- Skapa en lista med alla kolumner som ska tas bort,
to_drop. - Ta bort dessa kolumner från
ufo. - Använd funktionen
words_to_filter()som du skapade tidigare; skicka invocab,vec.vocabulary_,desc_tfidfoch ange4som sista parameter för att behålla de fyra vanligaste orden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)