Wybór optymalnego zbioru danych
Czas pozbyć się zbędnych cech ze zbioru danych ufo. Kolumna country została zakodowana jako country_enc, więc możesz ją zachować i usunąć pozostałe kolumny związane z lokalizacją: city, country, lat, long oraz state.
Skoro utworzyłeś kolumny month i year, kolumny date i recorded nie są już potrzebne. Kolumna seconds została zestandaryzowana jako seconds_log, więc możesz usunąć seconds i minutes.
Kolumna desc została zwektoryzowana, więc można ją usunąć. Na razie zachowaj kolumnę type.
Możesz również pozbyć się kolumny length_of_time, która stała się zbędna po wyodrębnieniu wartości minutes.
To ćwiczenie jest częścią kursu
Preprocessing w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Utwórz listę wszystkich kolumn do usunięcia –
to_drop. - Usuń te kolumny ze zbioru
ufo. - Użyj funkcji
words_to_filter(), którą wcześniej utworzyłeś; przekaż jejvocab,vec.vocabulary_,desc_tfidfi jako ostatni parametr podaj4– czyli liczbę słów, które chcesz zachować.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)