Кластеризация Wikipedia. Часть II
Пришло время применить конвейер из предыдущего упражнения на практике! Вам дан массив articles с tf-idf-частотами слов для нескольких популярных статей Wikipedia, а также список titles с их названиями. Используйте конвейер, чтобы кластеризовать статьи Wikipedia.
Решение предыдущего упражнения уже загружено, поэтому конвейер pipeline, объединяющий TruncatedSVD и KMeans, доступен для использования.
Это упражнение является частью курса
Обучение без учителя на Python
Инструкции к упражнению
- Импортируйте
pandasпод псевдонимомpd. - Обучите конвейер на массиве частот слов
articles. - Предскажите метки кластеров.
- Сопоставьте метки кластеров со списком названий статей
titles, создав DataFramedfсо столбцамиlabelsиtitles. Этот шаг уже выполнен за вас. - Используйте метод
.sort_values()объектаdf, чтобы отсортировать DataFrame по столбцу'label', и выведите результат. - Нажмите «Отправить ответ» и изучите полученную кластеризацию статей Wikipedia!
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)