Zacznij terazZacznij za darmo

Kodowanie kolumn kategorycznych III: DictVectorizer

Świetnie, jeszcze jedna sztuczka, zanim przejdziesz do potoków. Dwuetapowy proces, przez który właśnie przeszłeś – LabelEncoder a następnie OneHotEncoder – można uprościć, korzystając z DictVectorizer.

Użycie DictVectorizer na DataFrame przekonwertowanym do słownika pozwala uzyskać zarówno kodowanie etykiet, jak i kodowanie „one-hot" w jednym kroku.

Twoim zadaniem jest zastosowanie tej strategii w tym ćwiczeniu!

To ćwiczenie jest częścią kursu

Extreme Gradient Boosting with XGBoost

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj DictVectorizer z sklearn.feature_extraction.
  • Przekonwertuj df do słownika o nazwie df_dict, używając metody .to_dict() z argumentem "records".
  • Utwórz instancję obiektu DictVectorizer o nazwie dv z argumentem kluczowym sparse=False.
  • Zastosuj DictVectorizer na df_dict, wywołując metodę .fit_transform().
  • Kliknij „Prześlij odpowiedź", aby wyświetlić pięć pierwszych wierszy wyniku oraz słownik cech.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import DictVectorizer
____

# Convert df into a dictionary: df_dict
df_dict = ____

# Create the DictVectorizer object: dv
dv = ____

# Apply dv on df: df_encoded
df_encoded = ____

# Print the resulting first five rows
print(df_encoded[:5,:])

# Print the vocabulary
print(dv.vocabulary_)
Edytuj i uruchom kod