Kom igångKom igång gratis

Ange tokenmönstret

I den här övningen arbetar du med kolumnen text i datamängden tweets. Din uppgift är att vektorisera objektkolumnen med hjälp av CountVectorizer. Du kommer att använda olika tokenmönster i vektoriseraren. Kom ihåg att du kan filtrera bort tecken genom att ange tokenmönstret.

CountVectorizer har redan importerats åt dig.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))
Redigera och kör kod