次のうち、ドキュメントベクトルの組に対して取り得るコサインスコアはどれですか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
単語数、文字数、平均単語長、特殊文字(Twitterのハッシュタグやメンションなど)の数といった基本的な特徴量の計算方法を学びます。さらに、可読性スコアの計算と、そのテキストを理解するために必要な教育レベルの推定方法も学習します。
この章では、トークン化とレンマ化について学びます。そのうえで、spaCyライブラリを使ってテキストクリーニング、品詞タグ付け、固有表現抽出を行う方法を学習します。これらの概念を身につけたら、ゲティスバーグ演説を機械処理しやすい形に整え、フェイクニュースにおける名詞の使われ方を分析し、TechCrunchの記事に登場する人物を特定していきます。
n-gramモデリングを学び、それを用いて映画レビューの感情分析を行います。
tf-idfの重みと2つのベクトル間のコサイン類似度スコアの計算方法を学びます。これらの概念を使って映画とTED Talkのレコメンダを構築します。最後に、単語埋め込みについて学び、単語ベクトル表現を用いてPink Floydのさまざまな楽曲間の類似度を計算します。
現在の演習