始める無料で始める

Twitterデータでの文字列演算子

text 列に各ツイートの内容が入っている tweets データを引き続き扱います。

あなたのタスクは、text 列をトークンのリストに変換することです。次に、文字列演算子を使って、作成したトークンのリストから英字以外の文字をすべて取り除いてください。

この演習はコースの一部です

Pythonで学ぶSentiment Analysis

コースを見る

演習の手順

  • 単語のトークナイズ関数をインポートします。
  • 各ツイートから単語トークンを作成します。
  • 作成したリストから英字以外のすべての文字を除外し、文字だけを残します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
コードを編集して実行