ПочатиПочніть безкоштовно

Кластеризація статей із Wikipedia, частина I

У відео ви бачили, що TruncatedSVD може виконувати PCA для розріджених масивів у форматі csr_matrix, наприклад для масивів частот слів. Поєднайте свої знання про TruncatedSVD і k-means, щоб кластеризувати популярні сторінки з Wikipedia. У цій вправі побудуйте конвеєр. У наступній вправі ви застосуєте його до масиву частот слів для деяких статей Wikipedia.

Створіть об'єкт Pipeline, що складається з TruncatedSVD, за яким іде KMeans. (Цього разу ми заздалегідь обчислили для вас матрицю частот слів, тож TfidfVectorizer не потрібен).

Набір даних Wikipedia, з яким ви працюватимете, отримано звідси: here.

Ця вправа є частиною курсу

Наглядове навчання в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте:
    • TruncatedSVD з sklearn.decomposition.
    • KMeans з sklearn.cluster.
    • make_pipeline з sklearn.pipeline.
  • Створіть екземпляр TruncatedSVD на ім'я svd з n_components=50.
  • Створіть екземпляр KMeans на ім'я kmeans з n_clusters=6.
  • Створіть конвеєр під назвою pipeline, що складається з svd і kmeans.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____

# Create a TruncatedSVD instance: svd
svd = ____

# Create a KMeans instance: kmeans
kmeans = ____

# Create a pipeline: pipeline
pipeline = ____
Редагувати та запускати код