토큰 얻기
다음 단계는 트윗 본문을 토크나이즈하는 것입니다. 토크나이즈는 문자열을 어휘 단위, 즉 더 쉽게 말해 단어로 분할하는 과정을 말해요. 하지만 먼저, 해시태그가 과정을 방해하지 않도록 제거해야 합니다. 해시태그는 # 기호로 시작하고, 공백은 포함하지 않으며 문자와 숫자로만 이루어진다는 점을 떠올리세요. 그다음에는 공백 패턴을 기준으로 텍스트를 분할해 토큰을 얻을 계획입니다.
다음과 같은 수량자 목록이 도움이 될 거예요: * 0회 이상, + 1회 이상, ? 0회 또는 1회, {n, m} 최소 n회, 최대 m회.
하나의 트윗 텍스트를 담고 있는 변수 sentiment_analysis와 re 모듈은 이미 세션에 로드되어 있습니다. IPython 셸에서 print(sentiment_analysis)로 내용을 확인할 수 있어요.
이 연습은 강의의 일부입니다
Python에서의 정규 표현식
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Write a regex matching the hashtag pattern
regex = r"____"