Wikipedia 클러스터링 II
이제 이전 연습 문제에서 만든 파이프라인을 실제로 사용해 볼 시간입니다! 인기 있는 Wikipedia 문서들의 tf-idf 단어 빈도 배열 articles와 그 제목 리스트 titles가 제공됩니다. 파이프라인을 사용해 Wikipedia 문서들을 클러스터링해 보세요.
이전 연습 문제의 해답이 이미 로드되어 있어 TruncatedSVD와 KMeans를 연결한 Pipeline pipeline을 바로 사용할 수 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Unsupervised Learning
연습 안내
pandas를pd로 임포트하세요.- 단어 빈도 배열
articles에 파이프라인을 맞추세요. - 클러스터 레이블을 예측하세요.
- 문서 제목 리스트
titles와 레이블 정렬을 위해labels와titles를 열로 갖는 DataFramedf를 만드세요. 이 부분은 이미 준비되어 있습니다. df의.sort_values()메서드로'label'열을 기준으로 정렬하고 결과를 출력하세요.- Submit을 눌러 실행한 뒤, 멋지게 클러스터링된 Wikipedia 페이지를 잠시 살펴보세요!
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)