Feature-Indizes mit Feature-Namen verknüpfen
Im Video zur Lektion hast du gesehen, dass CountVectorizer den Wortschatz nicht unbedingt in alphabetischer Reihenfolge indiziert. In dieser Übung lernst du, jeden Feature-Index dem entsprechenden Feature-Namen aus dem Vokabular zuzuordnen.
Wir verwenden dieselben drei Sätze über Löwen aus dem Video. Die Sätze stehen in einer Liste namens corpus und wurden bereits in der Konsole ausgegeben.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering für NLP in Python</Kurs>Übungsanweisungen
- Instanziiere ein
CountVectorizer-Objekt und nenne esvectorizer. - Erzeuge mit
fit_transform()diebow_matrixfürcorpus. - Ordne mit der Methode
get_feature_names()die Spaltennamen dem entsprechenden Wort im Vokabular zu.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)