Začněte nyníZačněte zdarma

BoW vektory pro filmové recenze

V tomto cvičení máš k dispozici dvě pandas Series, X_train a X_test, které obsahují filmové recenze — trénovací a testovací data. Tvým úkolem je recenze předzpracovat a pomocí CountVectorizer z nich vytvořit BoW vektory pro obě sady.

Jakmile budeme mít BoW maticové reprezentace X_train_bow a X_test_bow, budeme připraveni na nich natrénovat model strojového učení a provést analýzu sentimentu.

Toto cvičení je součástí kurzu

Feature Engineering for NLP in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj CountVectorizer z knihovny sklearn.
  • Vytvoř instanci CountVectorizer s názvem vectorizer. Zajisti, aby se všechna slova převáděla na malá písmena a odstraňovala se english stop slova.
  • Pomocí X_train natrénuj vectorizer a následně ho použij k transformaci X_train — výsledkem bude sada BoW vektorů X_train_bow.
  • Transformuj X_test pomocí vectorizer a vytvoř tak sadu BoW vektorů X_test_bow.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
Upravit a spustit kód