始める無料で始める

spaCy でのトークン化

この演習では、テキストのトークン化を練習します。Amazon Fine Food Reviews データセットの最初のレビューを使います。レビューは提供済みの text オブジェクトから参照できます。

en_core_web_sm モデルはすでに読み込まれており、nlp() を呼び出すことで利用できます。リスト内包表記を使って出力のリストを作成してみましょう。

この演習はコースの一部です

spaCyで学ぶNatural Language Processing

コースを見る

演習の手順

  • 事前に読み込まれているレビューを document オブジェクトとして Doc コンテナに格納します。
  • document のすべてのトークンのテキストを取り出し、first_text_tokens 変数に保存して確認します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create a Doc container of the given text
document = ____(____)
    
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")
コードを編集して実行