始める無料で始める

spaCy の語彙

単語ベクトル(word embeddings)は、テキストデータを使ってコンピュータが高度な処理を行えるようにする、単語の数値表現です。多くの spaCy モデルには単語ベクトルが含まれますが、含まれないモデルも一部あります。

この演習では、spaCy の語彙情報へのアクセスを練習します。単語ベクトルに関するメタ情報は各 spaCy モデルに保存されています。語彙サイズや単語ベクトルの次元数などの情報を取得して、詳細を確認できます。

spaCy パッケージはすでにインポートされています。spaCy モデルのメタデータでは、単語数は "vectors" キーの要素として、単語ベクトルの次元は "width" キーの要素として保存されています。

この演習はコースの一部です

spaCyで学ぶNatural Language Processing

コースを見る

演習の手順

  • en_core_web_md モデルを読み込みます。
  • en_core_web_md モデルの語彙に含まれる単語数を出力します。
  • en_core_web_md モデルの単語ベクトルの次元数を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the en_core_web_md model
md_nlp = ____

# Print the number of words in the model's vocabulary
print("Number of words: ", md_nlp.____["vectors"]["vectors"], "\n")

# Print the dimensions of word vectors in en_core_web_md model
print("Dimension of word vectors: ", md_nlp.____["vectors"]["width"])
コードを編集して実行