Кластеризация Wikipedia. Часть I
Из видео вы узнали, что TruncatedSVD умеет выполнять PCA на разреженных массивах в формате csr_matrix — например, на матрицах частот слов. Объедините знания о TruncatedSVD и методе k-средних, чтобы кластеризовать популярные страницы Wikipedia. В этом упражнении вы построите конвейер, а в следующем — применёте его к матрице частот слов статей Wikipedia.
Создайте объект Pipeline, состоящий из TruncatedSVD и KMeans. (Матрица частот слов уже предварительно вычислена, поэтому TfidfVectorizer в этот раз не понадобится.)
Набор данных Wikipedia, с которым вы будете работать, получен отсюда.
Это упражнение является частью курса
Обучение без учителя на Python
Инструкции к упражнению
- Импортируйте:
TruncatedSVDизsklearn.decomposition.KMeansизsklearn.cluster.make_pipelineизsklearn.pipeline.
- Создайте экземпляр
TruncatedSVDс именемsvdи параметромn_components=50. - Создайте экземпляр
KMeansс именемkmeansи параметромn_clusters=6. - Создайте конвейер с именем
pipeline, состоящий изsvdиkmeans.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____