spaCy の Doc コンテナ
spaCy のテキスト処理パイプラインの最初のステップは、与えられた文字列を処理済みテキストを保持する Doc コンテナに変換することです。この演習では、spaCy モデルの読み込み、nlp() オブジェクトの作成、Doc コンテナの作成、そして用意された text 文字列の処理を練習します。
en_core_web_sm モデルはすでにダウンロード済みです。
この演習はコースの一部です
spaCyで学ぶNatural Language Processing
演習の手順
en_core_web_smを読み込み、nlpオブジェクトを作成します。text文字列からdocコンテナを作成します。docコンテナ内の各トークンのテキストを含むリストを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load en_core_web_sm and create an nlp object
nlp = spacy.____(____)
# Create a Doc container for the text object
doc = ____(____)
# Create a list containing the text of each token in the Doc container
print([____ for ____ in ____])