Кластеризація статей із Wikipedia, частина I
У відео ви бачили, що TruncatedSVD може виконувати PCA для розріджених масивів у форматі csr_matrix, наприклад для масивів частот слів. Поєднайте свої знання про TruncatedSVD і k-means, щоб кластеризувати популярні сторінки з Wikipedia. У цій вправі побудуйте конвеєр. У наступній вправі ви застосуєте його до масиву частот слів для деяких статей Wikipedia.
Створіть об'єкт Pipeline, що складається з TruncatedSVD, за яким іде KMeans. (Цього разу ми заздалегідь обчислили для вас матрицю частот слів, тож TfidfVectorizer не потрібен).
Набір даних Wikipedia, з яким ви працюватимете, отримано звідси: here.
Ця вправа є частиною курсу
Наглядове навчання в Python
Інструкції до вправи
- Імпортуйте:
TruncatedSVDзsklearn.decomposition.KMeansзsklearn.cluster.make_pipelineзsklearn.pipeline.
- Створіть екземпляр
TruncatedSVDна ім'яsvdзn_components=50. - Створіть екземпляр
KMeansна ім'яkmeansзn_clusters=6. - Створіть конвеєр під назвою
pipeline, що складається зsvdіkmeans.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____