Zacznij terazZacznij za darmo

Grupowanie na podstawie wyników PCA

W tym ostatnim ćwiczeniu połączysz kilka kroków z poprzednich etapów i przekonasz się, jak wiele kreatywności wymaga uczenie nienadzorowane.

Przypomnij sobie z wcześniejszych ćwiczeń, że model PCA potrzebował znacznie mniejszej liczby cech, aby opisać 80% i 95% zmienności danych. Oprócz normalizacji danych i potencjalnego ograniczania przeuczenia, PCA usuwa też korelacje między zmiennymi, co czasem poprawia działanie innych technik modelowania.

Sprawdźmy, czy PCA poprawia, czy pogarsza wyniki grupowania hierarchicznego.

To ćwiczenie jest częścią kursu

Uczenie nienadzorowane w R

Zobacz kurs

Instrukcje do ćwiczenia

W przestrzeni roboczej nadal dostępne są: wisc.pr, diagnosis, wisc.hclust.clusters oraz wisc.km.

  • Korzystając z minimalnej liczby składowych głównych potrzebnej do opisania co najmniej 90% zmienności danych, utwórz hierarchiczny model grupowania z pełnym wiązaniem. Przypisz wyniki do wisc.pr.hclust.
  • Podziel ten hierarchiczny model grupowania na 4 klastry i przypisz wyniki do wisc.pr.hclust.clusters.
  • Używając funkcji table(), porównaj wyniki nowego hierarchicznego modelu grupowania z rzeczywistymi diagnozami. Jak dobrze nowo utworzony model z czterema klastrami rozdziela oba typy diagnoz?
  • Oceń, jak dobrze modele k-średnich i grupowania hierarchicznego utworzone w poprzednich ćwiczeniach radzą sobie z rozdzielaniem diagnoz. Ponownie użyj funkcji table(), aby porównać wyniki każdego modelu z wektorem zawierającym rzeczywiste diagnozy.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a hierarchical clustering model: wisc.pr.hclust
wisc.pr.hclust <- ___(dist(wisc.pr$___[, ___:___]), method = ___)

# Cut model into 4 clusters: wisc.pr.hclust.clusters


# Compare to actual diagnoses


# Compare to k-means and hierarchical
Edytuj i uruchom kod