始める無料で始める

ツイートからのステム抽出

この演習では、tweets という配列を扱います。これは Twitter から収集した航空会社のセンチメントデータのテキストを含みます。

この配列を処理し、リスト内包表記を使ってトークンのリストに変換してください。その後、トークンのリストを反復し、各トークンからステムを作成します。リスト内包表記は for ループの1行版であることを思い出してください。

この演習はコースの一部です

Pythonで学ぶSentiment Analysis

コースを見る

演習の手順

  • 文字列をステムに変換するために使用する関数をインポートします。
  • 先ほどインポートした Porter ステマー関数を呼び出します。
  • リスト内包表記を使って、tokens リストを作成します。これは tweets 配列のすべての単語トークンを含むようにします。
  • tokens リストを反復し、各要素にステミング関数を適用します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the function to perform stemming
____
from nltk import word_tokenize

# Call the stemmer
porter = ____()

# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens] 
# Print the first element of the list
print(stemmed_tokens[0])
コードを編集して実行