Mapowanie indeksów cech na nazwy cech
W filmie lekcyjnym widziałeś, że CountVectorizer nie zawsze indeksuje słownik w kolejności alfabetycznej. W tym ćwiczeniu nauczysz się mapować każdy indeks cechy na odpowiadającą mu nazwę ze słownika.
Wykorzystamy te same trzy zdania o lwach, co w filmie. Zdania są dostępne na liście o nazwie corpus i zostały już wyświetlone w konsoli.
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Instrukcje do ćwiczenia
- Utwórz obiekt
CountVectorizeri nadaj mu nazwęvectorizer. - Używając metody
fit_transform(), wygenerujbow_matrixdlacorpus. - Używając metody
get_feature_names(), przypisz nazwy kolumn do odpowiadających im słów ze słownika.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)