BoW-Modell für Filmtaglines
In dieser Übung bekommst du einen corpus mit mehr als 7000 Filmtaglines. Deine Aufgabe ist es, die Bag-of-Words-Darstellung bow_matrix für diese Taglines zu erzeugen. Für diese Übung überspringen wir die Textvorverarbeitung und erzeugen bow_matrix direkt.
Wir untersuchen außerdem die Form der resultierenden bow_matrix. Die ersten fünf Taglines in corpus wurden bereits zur Ansicht in der Konsole ausgegeben.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering für NLP in Python</Kurs>Übungsanweisungen
- Importiere die Klasse
CountVectorizeraussklearn. - Erzeuge ein
CountVectorizer-Objekt und nenne esvectorizer. - Erzeuge mit
fit_transform()diebow_matrixfürcorpus.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)