この演習では、4つのデータフレーム df1、df2、df3、df4 が与えられています。各データフレームの最後の列が目的変数で、それ以外の列が学習用の特徴量です。
df1
df2
df3
df4
コンソールを使って、どのデータフレームが分類器で学習可能な適切な形式になっているかを判断してください。
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
単語数、文字数、平均単語長、特殊文字(Twitterのハッシュタグやメンションなど)の数といった基本的な特徴量の計算方法を学びます。さらに、可読性スコアの計算と、そのテキストを理解するために必要な教育レベルの推定方法も学習します。
現在の演習
この章では、トークン化とレンマ化について学びます。そのうえで、spaCyライブラリを使ってテキストクリーニング、品詞タグ付け、固有表現抽出を行う方法を学習します。これらの概念を身につけたら、ゲティスバーグ演説を機械処理しやすい形に整え、フェイクニュースにおける名詞の使われ方を分析し、TechCrunchの記事に登場する人物を特定していきます。
n-gramモデリングを学び、それを用いて映画レビューの感情分析を行います。
tf-idfの重みと2つのベクトル間のコサイン類似度スコアの計算方法を学びます。これらの概念を使って映画とTED Talkのレコメンダを構築します。最後に、単語埋め込みについて学び、単語ベクトル表現を用いてPink Floydのさまざまな楽曲間の類似度を計算します。