始める無料で始める

spaCy でパイプを追加する

さまざまなNLPタスクで既存の spaCy モデルを使うことはよくあります。しかし、文分割のような既製のパイプラインコンポーネントでは、期待どおりの結果を得るまでに時間がかかる場合があります。この演習では、spaCy モデル(テキスト処理パイプライン)にパイプラインコンポーネントを追加する練習をします。

この演習では、Amazon Fine Food Reviews データセットの最初の5件のレビューを使用します。これらのレビューは、texts という文字列で参照できます。

spaCy パッケージはすでにインポート済みです。

この演習はコースの一部です

spaCyで学ぶNatural Language Processing

コースを見る

演習の手順

  • 空の英語の spaCy モデルを読み込み、sentencizer コンポーネントをモデルに追加します。
  • texts から Doc コンテナを作成し、その文を格納する sentences のリストを作成して、文の数を出力します。
  • sentences リストの2番目の文に含まれるトークンのリストを出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
コードを編集して実行