Vectori BoW pentru recenzii de filme
În acest exercițiu, ai la dispoziție două serii pandas, X_train și X_test, care conțin recenzii de filme. Acestea reprezintă, respectiv, datele de antrenament și datele de testare. Sarcina ta este să preprocesezi recenziile și să generezi vectori BoW pentru aceste două seturi folosind CountVectorizer.
Odată ce am generat matricele de vectori BoW X_train_bow și X_test_bow, vom fi pregătiți să aplicăm un model de învățare automată și să realizăm analiza sentimentelor.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru NLP în Python
Instrucțiuni pentru exercițiu
- Importă
CountVectorizerdin bibliotecasklearn. - Instanțiază un obiect
CountVectorizernumitvectorizer. Asigură-te că toate cuvintele sunt convertite la litere mici și că stopwords-urile dinenglishsunt eliminate. - Folosind
X_train, antreneazăvectorizer, apoi folosește-l pentru a transformaX_trainși a genera setul de vectori BoWX_train_bow. - Transformă
X_testfolosindvectorizerpentru a genera setul de vectori BoWX_test_bow.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)