Shlukování Wikipedie – část I
Ve videu jsi viděl/a, že TruncatedSVD dokáže provádět PCA na řídkých polích ve formátu csr_matrix, jako jsou například matice četností slov. Zkombinuj znalosti TruncatedSVD a k-means a shlukni populární stránky z Wikipedie. V tomto cvičení sestavíš pipeline – v dalším ji pak aplikuješ na matici četností slov z vybraných článků Wikipedie.
Vytvoř objekt Pipeline složený z TruncatedSVD následovaného KMeans. (Matici četností slov jsme pro tebe předpočítali, takže TfidfVectorizer tentokrát nepotřebuješ.)
Dataset z Wikipedie, se kterým budeš pracovat, pochází odtud.
Toto cvičení je součástí kurzu
Unsupervised Learning in Python
Pokyny k cvičení
- Importuj:
TruncatedSVDzsklearn.decomposition.KMeanszsklearn.cluster.make_pipelinezsklearn.pipeline.
- Vytvoř instanci
TruncatedSVDs názvemsvda parametremn_components=50. - Vytvoř instanci
KMeanss názvemkmeansa parametremn_clusters=6. - Vytvoř pipeline s názvem
pipelinesloženou zsvdakmeans.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____