НачатьНачать бесплатно

NMF извлекает темы документов

В видео вы узнали, что при применении NMF к документам компоненты соответствуют темам документов, а признаки NMF восстанавливают документы из этих тем. Убедитесь в этом самостоятельно на основе модели NMF, которую вы построили ранее с использованием статей Википедии. Ранее вы видели, что значение 3-й признаковой компоненты NMF было высоким для статей об актёрах Энн Хэтэуэй и Дензеле Вашингтоне. В этом упражнении определите тему соответствующей компоненты NMF.

Построенная вами ранее модель NMF доступна как model, а words — это список слов, которые обозначают столбцы массива частот слов.

По завершении найдите минуту, чтобы осознать, какая тема объединяет статьи об Энн Хэтэуэй и Дензеле Вашингтоне!

Это упражнение является частью курса

Обучение без учителя на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте pandas как pd.
  • Создайте DataFrame components_df из model.components_, задав columns=words, чтобы столбцы были обозначены словами.
  • Выведите components_df.shape, чтобы проверить размерность DataFrame.
  • Используйте accessor .iloc[] на DataFrame components_df, чтобы выбрать строку 3. Присвойте результат переменной component.
  • Вызовите метод .nlargest() для component и выведите результат. Это даст пять слов с наибольшими значениями для данной компоненты.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import pandas
import pandas as pd

# Create a DataFrame: components_df
components_df = ____

# Print the shape of the DataFrame
print(components_df.shape)

# Select row 3: component
component = ____

# Print result of nlargest
print(component.nlargest())
Редактировать и запускать код