始める無料で始める

spaCy による文分割

この演習では、文分割を練習します。NLP では、文書を文ごとに区切るのは有用な基本処理です。固有表現抽出のような、より複雑な多くの NLP タスクにおける最初のステップの一つです。さらに、文の数を把握することで、そのテキストがどの程度の情報量を含むかの手がかりにもなります。

texts というリストに、10 件のフードレビューが入っています。

en_core_web_sm モデルはすでに nlp として読み込まれています。

この演習はコースの一部です

spaCyで学ぶNatural Language Processing

コースを見る

演習の手順

  • texts リストの各要素に spaCy モデルを適用し、すべての Doc コンテナからなるリスト documents を作成します。
  • documents リストを反復し、各 doc コンテナの文を抽出して、sentences というリストに追加します。
  • sentences リストを使って、各 doc コンテナに含まれる文の数を数えます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]

# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
  sentences.append([s for s in ____.____])
  
# Find number of sentences per each doc container
print([len(____) for s in sentences])
コードを編集して実行