spaCy でのテキスト処理
すべての NLP アプリケーションは、いくつかのテキスト処理ステップで構成されています。これまでに、トークン化、レンマ化、文分割、固有表現認識などのステップを学びました。
この演習では、spaCy による文への分割や固有表現の抽出など、テキスト処理の手順を引き続き練習します。Amazon Fine Food Reviews データセットの最初の 5 件のレビューを使用します。これらのレビューには texts オブジェクトでアクセスできます。
en_core_web_sm モデルはすでに読み込まれており、nlp から利用できます。texts の各要素に対応する Doc コンテナのリストも事前に用意されており、documents で参照できます。
この演習はコースの一部です
spaCyで学ぶNatural Language Processing
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]
# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)