Zacznij terazZacznij za darmo

Określ wzorzec tokenów

W tym ćwiczeniu będziesz pracować z kolumną text ze zbioru danych tweets. Twoim zadaniem jest wektoryzacja kolumny obiektowej za pomocą CountVectorizer. Zastosuj różne wzorce tokenów w wektoryzatorze. Pamiętaj, że określając wzorzec tokenów, możesz odfiltrować wybrane znaki.

CountVectorizer został już zaimportowany.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))
Edytuj i uruchom kod