次の2次元配列のうち、非負のデータの例はどれでしょうか。
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
データセットに潜むグループ(「クラスター」)を見つけ出す方法を学びます。この章では、株価データを使って企業をクラスタリングしたり、測定値をもとに異なる品種を区別したりできるようになります。
この章では、データ可視化のための教師なし学習手法、「階層的クラスタリング」と「t-SNE」について学びます。階層的クラスタリングは、データを少しずつまとめて大きなクラスターへと段階的に統合し、クラスターの階層構造を樹形図として可視化します。一方t-SNE は、データを2次元空間にマッピングすることで、データ同士の近さを視覚的に表現します。
次元削減とは、データセットによく現れるパターンを使って情報を要約する手法です。この章では、次元削減手法の中でも最も基本的な「主成分分析(PCA)」について学びます。PCAは、モデルの性能や汎化性能を高めるために、教師あり学習の前処理として使われることがよくあります。また、教師なし学習でも役立ちます。例えば、PCAの応用手法を使って、Wikipediaの記事をその内容に基づいてクラスタリングすることができます。
この章では、データを解釈可能なパーツに分解する次元削減手法「非負値行列因子分解(NMF)」について学びます。例えば、ドキュメントをトピック別にしたり、画像を頻出する視覚的パターン別にしたりできます。また、NMFを使って、類似記事の表示や、視聴履歴に合った音楽アーティストのレコメンドシステムの構築もできます。
現在の演習