NMF вивчає теми документів
У відео ви дізналися, що коли NMF застосовують до документів, компоненти відповідають темам документів, а ознаки NMF відновлюють документи з тем. Переконайтеся в цьому самостійно для моделі NMF, яку ви будували раніше, використовуючи статті з Wikipedia. Раніше ви бачили, що значення 3-ї ознаки NMF було високим для статей про акторів Енн Гетевей і Дензела Вашингтона. У цій вправі визначте тему відповідного компонента NMF.
Модель NMF, яку ви створили раніше, доступна як model, а words — це список слів, якими позначено стовпці масиву частот слів.
Коли закінчите, подумайте, яку спільну тему мають статті про Енн Гетевей і Дензела Вашингтона!
Ця вправа є частиною курсу
Наглядове навчання в Python
Інструкції до вправи
- Імпортуйте
pandasякpd. - Створіть DataFrame
components_dfзmodel.components_, вказавшиcolumns=words, щоб стовпці були підписані словами. - Виведіть
components_df.shape, щоб перевірити розміри DataFrame. - Скористайтеся індексатором
.iloc[]для DataFramecomponents_df, щоб вибрати рядок3. Присвойте результат зміннійcomponent. - Викличте метод
.nlargest()уcomponentта виведіть результат. Це дасть п'ять слів із найбільшими значеннями для цього компонента.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import pandas
import pandas as pd
# Create a DataFrame: components_df
components_df = ____
# Print the shape of the DataFrame
print(components_df.shape)
# Select row 3: component
component = ____
# Print result of nlargest
print(component.nlargest())