NMF se učí témata dokumentů
Ve videu jsi se dozvěděl/a, že při aplikaci NMF na dokumenty odpovídají komponenty tématům těchto dokumentů a NMF příznaky rekonstruují dokumenty z daných témat. Ověř si to sám/sama na NMF modelu, který jsi sestavil/a dříve pomocí článků z Wikipedie. V předchozí části sis všiml/a, že 3. hodnota příznaku NMF byla vysoká u článků o hercích Anne Hathawayové a Denzelu Washingtonovi. V tomto cvičení identifikuješ téma odpovídající NMF komponenty.
NMF model, který jsi sestavil/a dříve, je dostupný jako model, a words je seznam slov, která označují sloupce pole frekvencí slov.
Až budeš hotov/a, zamysli se nad tím, jaké téma mají články o Anne Hathawayové a Denzelu Washingtonovi společné!
Toto cvičení je součástí kurzu
Unsupervised Learning in Python
Pokyny k cvičení
- Importuj
pandasjakopd. - Vytvoř DataFrame
components_dfzmodel.components_a nastavcolumns=words, aby byly sloupce pojmenované podle slov. - Vypiš
components_df.shapea zkontroluj rozměry DataFramu. - Pomocí přístupového objektu
.iloc[]na DataFramucomponents_dfvyber řádek3. Výsledek přiřaď do proměnnécomponent. - Zavolej metodu
.nlargest()nacomponenta výsledek vypiš. Zobrazí se pět slov s nejvyššími hodnotami pro danou komponentu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import pandas
import pandas as pd
# Create a DataFrame: components_df
components_df = ____
# Print the shape of the DataFrame
print(components_df.shape)
# Select row 3: component
component = ____
# Print result of nlargest
print(component.nlargest())