Кластеризація Wikipedia, частина II
Час задіяти ваш конвеєр із попередньої вправи! Вам надано масив articles з tf-idf частотами слів для кількох популярних статей Wikipedia та список titles з їхніми назвами. Використайте свій конвеєр, щоб кластеризувати ці статті.
Розв'язок попередньої вправи вже завантажено, тож доступний Pipeline pipeline, що поєднує TruncatedSVD і KMeans.
Ця вправа є частиною курсу
Наглядове навчання в Python
Інструкції до вправи
- Імпортуйте
pandasякpd. - Навчіть конвеєр на масиві частот слів
articles. - Передбачте мітки кластерів.
- Узгодьте мітки кластерів зі списком назв статей
titles, створивши датафреймdfзі стовпцямиlabelsіtitles. Це вже зроблено для вас. - Використайте метод
.sort_values()об'єктаdf, щоб відсортувати датафрейм за стовпцем'label', і виведіть результат. - Натисніть Submit Answer і приділіть хвилинку, щоб роздивитися вашу чудову кластеризацію сторінок Wikipedia!
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)