LoslegenKostenlos starten

Dimensionalität und Vorverarbeitung analysieren

In dieser Übung bekommst du ein lem_corpus, das die vorverarbeiteten Versionen der Film-Taglines aus der vorherigen Übung enthält. Mit anderen Worten: Die Taglines wurden kleingeschrieben und lemmatisiert, und Stoppwörter wurden entfernt.

Deine Aufgabe ist es, die Bag-of-Words-Repräsentation bow_lem_matrix für diese lemmatisierten Taglines zu erzeugen und ihre Form mit der von bow_matrix aus der vorherigen Übung zu vergleichen. Die ersten fünf lemmatisierten Taglines in lem_corpus wurden zur Ansicht in der Konsole ausgegeben.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering für NLP in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Importiere die Klasse CountVectorizer aus sklearn.
  • Erzeuge ein CountVectorizer-Objekt. Nenne es vectorizer.
  • Erzeuge mit fit_transform() bow_lem_matrix für lem_corpus.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
Code bearbeiten und ausführen