토큰 패턴 지정하기
이번 연습에서는 tweets 데이터셋의 text 열을 사용해 봅니다. 과제는 CountVectorizer를 사용하여 이 객체 열을 벡터화하는 것입니다. 벡터라이저에서 서로 다른 토큰 패턴을 적용해 보세요. 토큰 패턴을 지정하면 특정 문자를 걸러낼 수 있다는 점을 기억하세요.
CountVectorizer는 이미 임포트되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Sentiment Analysis
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))