spaCy による文分割
この演習では、文分割を練習します。NLP では、文書を文ごとに区切るのは有用な基本処理です。固有表現抽出のような、より複雑な多くの NLP タスクにおける最初のステップの一つです。さらに、文の数を把握することで、そのテキストがどの程度の情報量を含むかの手がかりにもなります。
texts というリストに、10 件のフードレビューが入っています。
en_core_web_sm モデルはすでに nlp として読み込まれています。
この演習はコースの一部です
spaCyで学ぶNatural Language Processing
演習の手順
textsリストの各要素にspaCyモデルを適用し、すべてのDocコンテナからなるリストdocumentsを作成します。documentsリストを反復し、各docコンテナの文を抽出して、sentencesというリストに追加します。sentencesリストを使って、各docコンテナに含まれる文の数を数えます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])