Specifică tiparul de tokeni
În acest exercițiu, vei lucra cu coloana text din setul de date tweets. Sarcina ta este să vectorizezi coloana de tip obiect folosind CountVectorizer. Vei aplica tipare diferite de tokeni în vectorizator. Reține că, prin specificarea tiparului de tokeni, poți filtra anumite caractere.
CountVectorizer a fost deja importat pentru tine.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))