LoslegenKostenlos starten

BoW-Modell für Filmtaglines

In dieser Übung bekommst du einen corpus mit mehr als 7000 Filmtaglines. Deine Aufgabe ist es, die Bag-of-Words-Darstellung bow_matrix für diese Taglines zu erzeugen. Für diese Übung überspringen wir die Textvorverarbeitung und erzeugen bow_matrix direkt.

Wir untersuchen außerdem die Form der resultierenden bow_matrix. Die ersten fünf Taglines in corpus wurden bereits zur Ansicht in der Konsole ausgegeben.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering für NLP in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Importiere die Klasse CountVectorizer aus sklearn.
  • Erzeuge ein CountVectorizer-Objekt und nenne es vectorizer.
  • Erzeuge mit fit_transform() die bow_matrix für corpus.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
Code bearbeiten und ausführen