Kom igångKom igång gratis

Välj den optimala datamängden

Nu är det dags att ta bort några onödiga särdrag från datamängden ufo. Eftersom kolumnen country har kodats som country_enc kan du behålla den och ta bort de övriga platsrelaterade kolumnerna: city, country, lat, long och state.

Du har skapat kolumnerna month och year, så du behöver inte längre date eller recorded. Du har också standardiserat kolumnen seconds som seconds_log, vilket innebär att du kan ta bort seconds och minutes.

Du har vektoriserat desc, så den kan tas bort. Tills vidare behåller du type.

Du kan också ta bort kolumnen length_of_time, som är överflödig efter att du extraherat minutes.

Den här övningen är en del av kursen

Förbehandling för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Skapa en lista med alla kolumner som ska tas bort, to_drop.
  • Ta bort dessa kolumner från ufo.
  • Använd funktionen words_to_filter() som du skapade tidigare; skicka in vocab, vec.vocabulary_, desc_tfidf och ange 4 som sista parameter för att behålla de fyra vanligaste orden.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Make a list of features to drop
to_drop = [____]

# Drop those features
ufo_dropped = ufo.____

# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)
Redigera och kör kod