Określ wzorzec tokenów
W tym ćwiczeniu będziesz pracować z kolumną text ze zbioru danych tweets. Twoim zadaniem jest wektoryzacja kolumny obiektowej za pomocą CountVectorizer. Zastosuj różne wzorce tokenów w wektoryzatorze. Pamiętaj, że określając wzorzec tokenów, możesz odfiltrować wybrane znaki.
CountVectorizer został już zaimportowany.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))