or
この演習はコースの一部です
「Rで学ぶ自然言語処理入門」の第1章では、はじめてのテキスト分析を実行できるよう準備します。正規表現とトークナイゼーションという、ほとんどの分析で頻出の2つの要素を学びます。正規表現を使うと、思いつくあらゆるパターンを検索でき、トークナイゼーションによって、より高度な分析に向けてテキストを整形・クレンジングできます。本章は、この後の章で学ぶテクニックに取り組むための必須の土台となります。
この章では、テキストを分析するうえで最も一般的で研究の進んだ手法を学びます。テキストコーパスの作成、Bag-of-Words 表現から TFIDF 行列への拡張、さらにコサイン類似度を用いて2つのテキスト同士の近さを測る方法を見ていきます。第3章・第4章で NLP の応用に進む前に、NLP を実践するための基礎をさらに固めていきます。
第3章では、テキスト分析でよく使われる2つのアプローチ、分類モデルとトピックモデリングに焦点を当てます。テキスト分析のプロジェクトに取り組むと、いずれか、あるいは両方の手法を使うことになるでしょう。本章ではそれぞれの手法をどのように実行するかを学び、実務的な観点からの取り組み方についても理解を深めます。
現在の演習
第4章では、自然言語処理の定番である感情分析と単語埋め込みを扱います。どちらもテキスト分析の基礎を学ぶうえで欠かせない手法です。さらに、BERT、品詞タグ付け、固有表現抽出についても簡潔に学びます。本コースでは合計で約15種類の分析手法を取り上げるため、第4章の最後に、学んだ主要なテクニックを振り返ります。