BoW-Vektoren für Filmrezensionen
In dieser Übung bekommst du zwei pandas-Serien, X_train und X_test, die aus Filmrezensionen bestehen. Sie repräsentieren die Trainings- bzw. Testdaten. Deine Aufgabe ist es, die Rezensionen vorzuverarbeiten und für beide Mengen mit CountVectorizer BoW-Vektoren zu erzeugen.
Sobald wir die BoW-Vektormatrizen X_train_bow und X_test_bow erzeugt haben, sind wir bestens aufgestellt, um ein Machine-Learning-Modell darauf anzuwenden und eine Sentimentanalyse durchzuführen.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering für NLP in Python</Kurs>Übungsanweisungen
- Importiere
CountVectorizeraus dersklearn-Bibliothek. - Erzeuge ein
CountVectorizer-Objekt namensvectorizer. Stelle sicher, dass alle Wörter in Kleinbuchstaben umgewandelt werden undenglish-Stoppwörter entfernt werden. - Fitte
vectorizermitX_trainund wandle anschließendX_traindamit um, um die Menge der BoW-VektorenX_train_bowzu erzeugen. - Wandle
X_testmitvectorizerum, um die Menge der BoW-VektorenX_test_bowzu erzeugen.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)