Mappa särdragsindex till särdragsnamn
I lektionsvideon såg vi att CountVectorizer inte nödvändigtvis indexerar vokabulären i alfabetisk ordning. I den här övningen lär du dig att mappa varje särdragsindex till motsvarande särdragsnamn i vokabulären.
Vi använder samma tre meningar om lejon som i videon. Meningarna finns tillgängliga i en lista med namnet corpus och har redan skrivits ut i konsolen.
Den här övningen är en del av kursen
Funktionsutveckling för NLP i Python
Övningsinstruktioner
- Skapa ett
CountVectorizer-objekt och döp det tillvectorizer. - Använd
fit_transform()för att genererabow_matrixförcorpus. - Använd metoden
get_feature_names()för att mappa kolumnnamnen till motsvarande ord i vokabulären.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)