or
この演習はコースの一部です
テキストは非構造化データのため、分析できる形にするには一定の整形が必要です。この章では、トークン化やクレンジングを行い、テキストをカテゴリカルデータとして扱うことで、テキストに構造を与える方法を学びます。
単なるカウントも有用ですが、可視化はさらに効果的です。この章では、ggplot2の知識をtidyなテキストデータに応用する方法を学びます。
単語数や可視化から内容の傾向は見えてきますが、さらに踏み込むことができます。この章では、単語数の集計だけを超えて、テキストの感情(情緒的な極性)を分析します。
現在の演習
最終章では、単語数の集計をさらに進め、文書集合に潜むトピックを明らかにします。一般的なトピックモデルである潜在Dirichlet配分(latent Dirichlet allocation)を用います。