spaCy でパイプを追加する
さまざまなNLPタスクで既存の spaCy モデルを使うことはよくあります。しかし、文分割のような既製のパイプラインコンポーネントでは、期待どおりの結果を得るまでに時間がかかる場合があります。この演習では、spaCy モデル(テキスト処理パイプライン)にパイプラインコンポーネントを追加する練習をします。
この演習では、Amazon Fine Food Reviews データセットの最初の5件のレビューを使用します。これらのレビューは、texts という文字列で参照できます。
spaCy パッケージはすでにインポート済みです。
この演習はコースの一部です
spaCyで学ぶNatural Language Processing
演習の手順
- 空の英語の
spaCyモデルを読み込み、sentencizerコンポーネントをモデルに追加します。 textsからDocコンテナを作成し、その文を格納するsentencesのリストを作成して、文の数を出力します。sentencesリストの2番目の文に含まれるトークンのリストを出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])