始める無料で始める

spaCy でのテキスト処理

すべての NLP アプリケーションは、いくつかのテキスト処理ステップで構成されています。これまでに、トークン化、レンマ化、文分割、固有表現認識などのステップを学びました。

spaCy NLP Pipeline

この演習では、spaCy による文への分割や固有表現の抽出など、テキスト処理の手順を引き続き練習します。Amazon Fine Food Reviews データセットの最初の 5 件のレビューを使用します。これらのレビューには texts オブジェクトでアクセスできます。

en_core_web_sm モデルはすでに読み込まれており、nlp から利用できます。texts の各要素に対応する Doc コンテナのリストも事前に用意されており、documents で参照できます。

この演習はコースの一部です

spaCyで学ぶNatural Language Processing

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]

# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)
コードを編集して実行