Dimensionalität und Vorverarbeitung analysieren
In dieser Übung bekommst du ein lem_corpus, das die vorverarbeiteten Versionen der Film-Taglines aus der vorherigen Übung enthält. Mit anderen Worten: Die Taglines wurden kleingeschrieben und lemmatisiert, und Stoppwörter wurden entfernt.
Deine Aufgabe ist es, die Bag-of-Words-Repräsentation bow_lem_matrix für diese lemmatisierten Taglines zu erzeugen und ihre Form mit der von bow_matrix aus der vorherigen Übung zu vergleichen. Die ersten fünf lemmatisierten Taglines in lem_corpus wurden zur Ansicht in der Konsole ausgegeben.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering für NLP in Python</Kurs>Übungsanweisungen
- Importiere die Klasse
CountVectorizeraussklearn. - Erzeuge ein
CountVectorizer-Objekt. Nenne esvectorizer. - Erzeuge mit
fit_transform()bow_lem_matrixfürlem_corpus.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)