Zadej vzor tokenů
V tomto cvičení budeš pracovat se sloupcem text datové sady tweets. Tvým úkolem je vektorizovat sloupcový objekt pomocí CountVectorizer. Vyzkouš různé vzory tokenů ve vektorizátoru. Pamatuj, že zadáním vzoru tokenů můžeš filtrovat určité znaky.
CountVectorizer je už naimportovaný.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))