BoW vektory pro filmové recenze
V tomto cvičení máš k dispozici dvě pandas Series, X_train a X_test, které obsahují filmové recenze — trénovací a testovací data. Tvým úkolem je recenze předzpracovat a pomocí CountVectorizer z nich vytvořit BoW vektory pro obě sady.
Jakmile budeme mít BoW maticové reprezentace X_train_bow a X_test_bow, budeme připraveni na nich natrénovat model strojového učení a provést analýzu sentimentu.
Toto cvičení je součástí kurzu
Feature Engineering for NLP in Python
Pokyny k cvičení
- Importuj
CountVectorizerz knihovnysklearn. - Vytvoř instanci
CountVectorizers názvemvectorizer. Zajisti, aby se všechna slova převáděla na malá písmena a odstraňovala seenglishstop slova. - Pomocí
X_trainnatrénujvectorizera následně ho použij k transformaciX_train— výsledkem bude sada BoW vektorůX_train_bow. - Transformuj
X_testpomocívectorizera vytvoř tak sadu BoW vektorůX_test_bow.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)