Phân cụm Wikipedia - phần II
Đã đến lúc bạn đưa pipeline từ bài trước vào sử dụng! Bạn có mảng articles chứa tf-idf tần suất từ của một số bài viết Wikipedia phổ biến, và danh sách titles gồm tiêu đề của chúng. Hãy dùng pipeline để phân cụm các bài viết Wikipedia.
Lời giải của bài trước đã được nạp sẵn cho bạn, nên một Pipeline pipeline kết hợp TruncatedSVD với KMeans đã sẵn sàng.
Bài tập này là một phần của khóa học
Unsupervised Learning bằng Python
Hướng dẫn bài tập
- Import
pandasvới bí danhpd. - Fit pipeline lên mảng tần suất từ
articles. - Dự đoán các nhãn cụm.
- Căn thẳng các nhãn cụm với danh sách tiêu đề bài viết
titlesbằng cách tạo DataFramedfvới các cộtlabelsvàtitles. Phần này đã được làm sẵn cho bạn. - Dùng phương thức
.sort_values()củadfđể sắp xếp DataFrame theo cột'label', rồi in kết quả. - Nhấn Gửi và dành chút thời gian xem xét kết quả phân cụm Wikipedia tuyệt vời của bạn!
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)