Klasteryzacja Wikipedii – część I
W filmie pokazano, że TruncatedSVD potrafi wykonywać PCA na rzadkich macierzach w formacie csr_matrix, takich jak macierze częstości słów. Połącz wiedzę o TruncatedSVD i k-means, aby sklasteryzować wybrane popularne artykuły z Wikipedii. W tym ćwiczeniu zbudujesz potok. W następnym ćwiczeniu zastosujesz go do macierzy częstości słów artykułów z Wikipedii.
Utwórz obiekt Pipeline składający się z TruncatedSVD oraz KMeans. (Tym razem macierz częstości słów jest już wstępnie obliczona, więc TfidfVectorizer nie jest potrzebny).
Zbiór danych z Wikipedii, z którym będziesz pracować, pochodzi z tej strony.
To ćwiczenie jest częścią kursu
Uczenie nienadzorowane w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj:
TruncatedSVDzsklearn.decomposition.KMeanszsklearn.cluster.make_pipelinezsklearn.pipeline.
- Utwórz instancję
TruncatedSVDo nazwiesvdz parametremn_components=50. - Utwórz instancję
KMeanso nazwiekmeansz parametremn_clusters=6. - Utwórz potok o nazwie
pipelineskładający się zsvdikmeans.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____