Ange tokenmönstret
I den här övningen arbetar du med kolumnen text i datamängden tweets. Din uppgift är att vektorisera objektkolumnen med hjälp av CountVectorizer. Du kommer att använda olika tokenmönster i vektoriseraren. Kom ihåg att du kan filtrera bort tecken genom att ange tokenmönstret.
CountVectorizer har redan importerats åt dig.
Den här övningen är en del av kursen
Sentimentanalys i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))