НачатьНачать бесплатно

Кластеризация Wikipedia. Часть I

Из видео вы узнали, что TruncatedSVD умеет выполнять PCA на разреженных массивах в формате csr_matrix — например, на матрицах частот слов. Объедините знания о TruncatedSVD и методе k-средних, чтобы кластеризовать популярные страницы Wikipedia. В этом упражнении вы построите конвейер, а в следующем — применёте его к матрице частот слов статей Wikipedia.

Создайте объект Pipeline, состоящий из TruncatedSVD и KMeans. (Матрица частот слов уже предварительно вычислена, поэтому TfidfVectorizer в этот раз не понадобится.)

Набор данных Wikipedia, с которым вы будете работать, получен отсюда.

Это упражнение является частью курса

Обучение без учителя на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте:
    • TruncatedSVD из sklearn.decomposition.
    • KMeans из sklearn.cluster.
    • make_pipeline из sklearn.pipeline.
  • Создайте экземпляр TruncatedSVD с именем svd и параметром n_components=50.
  • Создайте экземпляр KMeans с именем kmeans и параметром n_clusters=6.
  • Создайте конвейер с именем pipeline, состоящий из svd и kmeans.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____

# Create a TruncatedSVD instance: svd
svd = ____

# Create a KMeans instance: kmeans
kmeans = ____

# Create a pipeline: pipeline
pipeline = ____
Редактировать и запускать код