spaCy でのトークン化
この演習では、テキストのトークン化を練習します。Amazon Fine Food Reviews データセットの最初のレビューを使います。レビューは提供済みの text オブジェクトから参照できます。
en_core_web_sm モデルはすでに読み込まれており、nlp() を呼び出すことで利用できます。リスト内包表記を使って出力のリストを作成してみましょう。
この演習はコースの一部です
spaCyで学ぶNatural Language Processing
演習の手順
- 事前に読み込まれているレビューを
documentオブジェクトとして Doc コンテナに格納します。 documentのすべてのトークンのテキストを取り出し、first_text_tokens変数に保存して確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")