ツイートからのステム抽出
この演習では、tweets という配列を扱います。これは Twitter から収集した航空会社のセンチメントデータのテキストを含みます。
この配列を処理し、リスト内包表記を使ってトークンのリストに変換してください。その後、トークンのリストを反復し、各トークンからステムを作成します。リスト内包表記は for ループの1行版であることを思い出してください。
この演習はコースの一部です
Pythonで学ぶSentiment Analysis
演習の手順
- 文字列をステムに変換するために使用する関数をインポートします。
- 先ほどインポートした Porter ステマー関数を呼び出します。
- リスト内包表記を使って、
tokensリストを作成します。これはtweets配列のすべての単語トークンを含むようにします。 tokensリストを反復し、各要素にステミング関数を適用します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the function to perform stemming
____
from nltk import word_tokenize
# Call the stemmer
porter = ____()
# Transform the array of tweets to tokens
tokens = [____]
# Stem the list of tokens
stemmed_tokens = [[____.____(word) for word in tweet] for tweet in tokens]
# Print the first element of the list
print(stemmed_tokens[0])