NMF извлекает темы документов
В видео вы узнали, что при применении NMF к документам компоненты соответствуют темам документов, а признаки NMF восстанавливают документы из этих тем. Убедитесь в этом самостоятельно на основе модели NMF, которую вы построили ранее с использованием статей Википедии. Ранее вы видели, что значение 3-й признаковой компоненты NMF было высоким для статей об актёрах Энн Хэтэуэй и Дензеле Вашингтоне. В этом упражнении определите тему соответствующей компоненты NMF.
Построенная вами ранее модель NMF доступна как model, а words — это список слов, которые обозначают столбцы массива частот слов.
По завершении найдите минуту, чтобы осознать, какая тема объединяет статьи об Энн Хэтэуэй и Дензеле Вашингтоне!
Это упражнение является частью курса
Обучение без учителя на Python
Инструкции к упражнению
- Импортируйте
pandasкакpd. - Создайте DataFrame
components_dfизmodel.components_, задавcolumns=words, чтобы столбцы были обозначены словами. - Выведите
components_df.shape, чтобы проверить размерность DataFrame. - Используйте accessor
.iloc[]на DataFramecomponents_df, чтобы выбрать строку3. Присвойте результат переменнойcomponent. - Вызовите метод
.nlargest()дляcomponentи выведите результат. Это даст пять слов с наибольшими значениями для данной компоненты.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import pandas
import pandas as pd
# Create a DataFrame: components_df
components_df = ____
# Print the shape of the DataFrame
print(components_df.shape)
# Select row 3: component
component = ____
# Print result of nlargest
print(component.nlargest())