Twitter 데이터로 문자열 연산자 사용하기
text 열에 각 트윗의 내용이 저장된 tweets 데이터를 계속 사용합니다.
여러분의 작업은 text 열을 토큰 리스트로 변환하는 것입니다. 그런 다음 문자열 연산자를 사용해 생성한 토큰 리스트에서 알파벳이 아닌 모든 문자를 제거하세요.
이 연습은 강의의 일부입니다
Python으로 배우는 Sentiment Analysis
연습 안내
- 단어 토크나이징 함수를 가져오세요.
- 각 트윗에서 단어 토큰을 생성하세요.
- 생성한 리스트에서 알파벳이 아닌 문자를 모두 걸러내세요. 즉, 문자만 남기세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import the word tokenizing package
____
# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])
# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])