ÎncepețiÎncepe gratuit

Vectori BoW pentru recenzii de filme

În acest exercițiu, ai la dispoziție două serii pandas, X_train și X_test, care conțin recenzii de filme. Acestea reprezintă, respectiv, datele de antrenament și datele de testare. Sarcina ta este să preprocesezi recenziile și să generezi vectori BoW pentru aceste două seturi folosind CountVectorizer.

Odată ce am generat matricele de vectori BoW X_train_bow și X_test_bow, vom fi pregătiți să aplicăm un model de învățare automată și să realizăm analiza sentimentelor.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru NLP în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă CountVectorizer din biblioteca sklearn.
  • Instanțiază un obiect CountVectorizer numit vectorizer. Asigură-te că toate cuvintele sunt convertite la litere mici și că stopwords-urile din english sunt eliminate.
  • Folosind X_train, antrenează vectorizer, apoi folosește-l pentru a transforma X_train și a genera setul de vectori BoW X_train_bow.
  • Transformă X_test folosind vectorizer pentru a genera setul de vectori BoW X_test_bow.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
Editează și rulează codul