or
この演習はコースの一部です
このチャプターでは、テキストの解析に役立つ、単語のトークン化と正規表現などの基本的な NLP の概念を紹介します。英語以外のテキストへの対応や、より難しいトークン化への対処法も学びます。
このチャプターでは、実世界のあらゆるテキストに適用できるトピック識別を紹介します。基本的な NLP モデルを使い、用語の出現頻度に基づいてテキストからトピックを特定します。NLTK と新しいライブラリ Gensim を使い、bag-of-words と Tf-idf の2つのシンプルな手法を試し、比較します。
このチャプターでは、少し進んだトピックである固有表現認識を扱います。英語および非英語のテキストに対する事前学習モデルを使って、テキスト中の「誰・何・どこ」を特定する方法を学びます。さらに、NLP ツールボックスに加える新しいライブラリとして、polyglot と spaCy の使い方も学びます。
現在の演習
これまでに学んだ基礎に、教師あり機械学習を組み合わせて「フェイクニュース」検出器を作成します。まず教師あり学習の基本を学び、その後、重要な特徴量をいくつか選び、アイデアを検証してフェイクニュース記事を識別・分類します。