spaCy の語彙
単語ベクトル(word embeddings)は、テキストデータを使ってコンピュータが高度な処理を行えるようにする、単語の数値表現です。多くの spaCy モデルには単語ベクトルが含まれますが、含まれないモデルも一部あります。
この演習では、spaCy の語彙情報へのアクセスを練習します。単語ベクトルに関するメタ情報は各 spaCy モデルに保存されています。語彙サイズや単語ベクトルの次元数などの情報を取得して、詳細を確認できます。
spaCy パッケージはすでにインポートされています。spaCy モデルのメタデータでは、単語数は "vectors" キーの要素として、単語ベクトルの次元は "width" キーの要素として保存されています。
この演習はコースの一部です
spaCyで学ぶNatural Language Processing
演習の手順
en_core_web_mdモデルを読み込みます。en_core_web_mdモデルの語彙に含まれる単語数を出力します。en_core_web_mdモデルの単語ベクトルの次元数を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the en_core_web_md model
md_nlp = ____
# Print the number of words in the model's vocabulary
print("Number of words: ", md_nlp.____["vectors"]["vectors"], "\n")
# Print the dimensions of word vectors in en_core_web_md model
print("Dimension of word vectors: ", md_nlp.____["vectors"]["width"])