LoslegenKostenlos starten

BoW-Vektoren für Filmrezensionen

In dieser Übung bekommst du zwei pandas-Serien, X_train und X_test, die aus Filmrezensionen bestehen. Sie repräsentieren die Trainings- bzw. Testdaten. Deine Aufgabe ist es, die Rezensionen vorzuverarbeiten und für beide Mengen mit CountVectorizer BoW-Vektoren zu erzeugen.

Sobald wir die BoW-Vektormatrizen X_train_bow und X_test_bow erzeugt haben, sind wir bestens aufgestellt, um ein Machine-Learning-Modell darauf anzuwenden und eine Sentimentanalyse durchzuführen.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering für NLP in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Importiere CountVectorizer aus der sklearn-Bibliothek.
  • Erzeuge ein CountVectorizer-Objekt namens vectorizer. Stelle sicher, dass alle Wörter in Kleinbuchstaben umgewandelt werden und english-Stoppwörter entfernt werden.
  • Fitte vectorizer mit X_train und wandle anschließend X_train damit um, um die Menge der BoW-Vektoren X_train_bow zu erzeugen.
  • Wandle X_test mit vectorizer um, um die Menge der BoW-Vektoren X_test_bow zu erzeugen.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
Code bearbeiten und ausführen