Zacznij terazZacznij za darmo

Mapowanie indeksów cech na nazwy cech

W filmie lekcyjnym widziałeś, że CountVectorizer nie zawsze indeksuje słownik w kolejności alfabetycznej. W tym ćwiczeniu nauczysz się mapować każdy indeks cechy na odpowiadającą mu nazwę ze słownika.

Wykorzystamy te same trzy zdania o lwach, co w filmie. Zdania są dostępne na liście o nazwie corpus i zostały już wyświetlone w konsoli.

To ćwiczenie jest częścią kursu

Inżynieria cech dla NLP w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz obiekt CountVectorizer i nadaj mu nazwę vectorizer.
  • Używając metody fit_transform(), wygeneruj bow_matrix dla corpus.
  • Używając metody get_feature_names(), przypisz nazwy kolumn do odpowiadających im słów ze słownika.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
Edytuj i uruchom kod