НачатьНачать бесплатно

Кластеризация Wikipedia. Часть II

Пришло время применить конвейер из предыдущего упражнения на практике! Вам дан массив articles с tf-idf-частотами слов для нескольких популярных статей Wikipedia, а также список titles с их названиями. Используйте конвейер, чтобы кластеризовать статьи Wikipedia.

Решение предыдущего упражнения уже загружено, поэтому конвейер pipeline, объединяющий TruncatedSVD и KMeans, доступен для использования.

Это упражнение является частью курса

Обучение без учителя на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте pandas под псевдонимом pd.
  • Обучите конвейер на массиве частот слов articles.
  • Предскажите метки кластеров.
  • Сопоставьте метки кластеров со списком названий статей titles, создав DataFrame df со столбцами labels и titles. Этот шаг уже выполнен за вас.
  • Используйте метод .sort_values() объекта df, чтобы отсортировать DataFrame по столбцу 'label', и выведите результат.
  • Нажмите «Отправить ответ» и изучите полученную кластеризацию статей Wikipedia!

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import pandas
____

# Fit the pipeline to articles
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})

# Display df sorted by cluster label
print(____)
Редактировать и запускать код