시작하기무료로 시작하기

Twitter 데이터로 문자열 연산자 사용하기

text 열에 각 트윗의 내용이 저장된 tweets 데이터를 계속 사용합니다.

여러분의 작업은 text 열을 토큰 리스트로 변환하는 것입니다. 그런 다음 문자열 연산자를 사용해 생성한 토큰 리스트에서 알파벳이 아닌 모든 문자를 제거하세요.

이 연습은 강의의 일부입니다

Python으로 배우는 Sentiment Analysis

강의 보기

연습 안내

  • 단어 토크나이징 함수를 가져오세요.
  • 각 트윗에서 단어 토큰을 생성하세요.
  • 생성한 리스트에서 알파벳이 아닌 문자를 모두 걸러내세요. 즉, 문자만 남기세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
코드 편집 및 실행