始める無料で始める

小文字化(Lowercasing)

旅行サイトのユーザーレビューを分析しています。レビューには "TRAVEL""travel" のように大文字・小文字が混在することがよくあります。感情分析やトピック抽出の前処理として、まずすべての単語を小文字に変換し、その後トークン化して、ストップワードと句読点を取り除きます。

word_tokenize() 関数と stop_words リストは用意されています。NLTK のリソースはすでにダウンロード済みです。

この演習はコースの一部です

Pythonで学ぶ自然言語処理(NLP)

コースを見る

演習の手順

  • 提供された review を小文字に変換します。
  • lower_text を単語にトークン化します。
  • リスト内包表記を使って、stop_wordsstring.punctuation のリストを用い、ストップワードと句読点を取り除きます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"

# Lowercase the review
lower_text = ____

# Tokenize the lower_text into words
tokens = ____

# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]

print(clean_tokens)
コードを編集して実行