LoslegenKostenlos starten

Feature-Indizes mit Feature-Namen verknüpfen

Im Video zur Lektion hast du gesehen, dass CountVectorizer den Wortschatz nicht unbedingt in alphabetischer Reihenfolge indiziert. In dieser Übung lernst du, jeden Feature-Index dem entsprechenden Feature-Namen aus dem Vokabular zuzuordnen.

Wir verwenden dieselben drei Sätze über Löwen aus dem Video. Die Sätze stehen in einer Liste namens corpus und wurden bereits in der Konsole ausgegeben.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering für NLP in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Instanziiere ein CountVectorizer-Objekt und nenne es vectorizer.
  • Erzeuge mit fit_transform() die bow_matrix für corpus.
  • Ordne mit der Methode get_feature_names() die Spaltennamen dem entsprechenden Wort im Vokabular zu.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
Code bearbeiten und ausführen