gender 資料集可以用兩個變數而不是一個來做叢集,但這會帶來額外的複雜度。在單變量的情況下,我們看到要估計的參數數量是 6:2 個平均數、2 個標準差和 2 個比例。
gender
當我們再加入一個變數,且考慮交叉項不為 0,我們仍需要估計兩個平均數,但每個平均數各由兩個數值組成。此外,共變異數矩陣由四個數值構成:對應的變異數與交叉項。
我們應該估計多少個彼此不同的數值(values)?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
在本章中,你將認識以模型為基礎的分群基本概念,以及此方法與其他分群技術有何不同。你會學到高斯混合模型的生成過程,並了解如何視覺化叢集。
本章將介紹混合模型的主要結構、如何用此方法處理不同型態的資料,以及如何估計其中的參數。為了完成估計,你會學到一種反覆運算的方法:Expectation-Maximization(EM)演算法。
本章示範如何使用 `flexmix` 套件,在 1 與 2 維上配適高斯混合模型。使用的資料包含 10,000 筆觀測,紀錄人們的體重、身高、身體質量指數,以及自述的性別。
當前練習
在本單元中,你將學到如何將混合模型擴展到高斯以外的機率分配,以及如何使用 `flexmix` 來配適這些模型。使用的資料集包含手寫數字影像與芝加哥市的犯罪件數。對第一個資料集,你會找到能概括手寫數字的叢集;對第二個資料集,你會找到社區的叢集,據以判斷哪些地方居住相對更危險或較安全。