Bag of words
自然言語処理の分野では、n-gramはテキストから特徴量を作るための基礎的な方法です。n-gramでは連続する単語の並びを数え、nは1つの並びに含まれる単語数を表します。たとえば、2-gramでは2語からなる並びの出現回数を数えます。
この演習では、サンプルテキストとシーケンス長(n)を選択し、出現回数に基づく上位の1-gram、2-gram、3-gramの特徴量と、それぞれの出現回数を確認します。
次の選択肢のうち、正しいものはどれですか?
この演習はコースの一部です
