Začněte nyníZačněte zdarma

Zadej vzor tokenů

V tomto cvičení budeš pracovat se sloupcem text datové sady tweets. Tvým úkolem je vektorizovat sloupcový objekt pomocí CountVectorizer. Vyzkouš různé vzory tokenů ve vektorizátoru. Pamatuj, že zadáním vzoru tokenů můžeš filtrovat určité znaky.

CountVectorizer je už naimportovaný.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))
Upravit a spustit kód