Clustering Wikipedia – Partea a II-a
A venit momentul să pui la treabă pipeline-ul construit în exercițiul anterior! Ai la dispoziție un array articles cu frecvențele tf-idf ale cuvintelor din câteva articole populare de pe Wikipedia și o listă titles cu titlurile acestora. Folosește pipeline-ul tău pentru a grupa articolele Wikipedia în clustere.
Soluția exercițiului anterior a fost preîncărcată, astfel că un Pipeline pipeline care înlănțuie TruncatedSVD cu KMeans este deja disponibil.
Acest exercițiu face parte din cursul
Învățare nesupervizată în Python
Instrucțiuni pentru exercițiu
- Importă
pandascapd. - Antrenează pipeline-ul pe matricea de frecvențe ale cuvintelor
articles. - Prezice etichetele clusterelor.
- Alinierea etichetelor clusterelor cu lista
titlesa titlurilor articolelor, prin crearea unui DataFramedfcu coloanelelabelsșititles, a fost deja realizată pentru tine. - Folosește metoda
.sort_values()a luidfpentru a sorta DataFrame-ul după coloana'label'și afișează rezultatul. - Apasă Trimite răspunsul și ia-ți un moment să explorezi rezultatul impresionant al grupării articolelor Wikipedia!
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)