ÎncepețiÎncepe gratuit

Specifică tiparul de tokeni

În acest exercițiu, vei lucra cu coloana text din setul de date tweets. Sarcina ta este să vectorizezi coloana de tip obiect folosind CountVectorizer. Vei aplica tipare diferite de tokeni în vectorizator. Reține că, prin specificarea tiparului de tokeni, poți filtra anumite caractere.

CountVectorizer a fost deja importat pentru tine.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))
Editează și rulează codul