spaCy パイプラインを実行する
すでに単一のテキストに対して spaCy の NLP パイプラインを実行し、Doc コンテナのリストからトークンを抽出しました。この演習では、テキスト文字列のリストである texts に対して spaCy パイプラインを実行する最初のステップを練習します。
この目的には en_core_web_sm モデルを使用します。spaCy パッケージはすでにインポート済みです。
この演習はコースの一部です
spaCyで学ぶNatural Language Processing
演習の手順
en_core_web_smモデルをnlpとして読み込みます。textsの各要素に対してnlp()モデルを実行し、対応するそれぞれのDocコンテナをdocumentsリストに追加します。documentsリスト内の各Docコンテナについて、各トークンのテキストを出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load en_core_web_sm model as nlp
nlp = spacy.____(____)
# Run an nlp model on each item of texts and append the Doc container to documents
documents = []
for text in ____:
documents.append(____)
# Print the token texts for each Doc container
for doc in documents:
print([____ for ____ in ____])