Kom igångKom igång gratis

NMF identifierar ämnen i dokument

I videon lärde du dig att när NMF tillämpas på dokument motsvarar komponenterna dokumentens ämnen, och att NMF-särdragen rekonstruerar dokumenten utifrån dessa ämnen. Verifiera detta på egen hand med hjälp av den NMF-modell du byggde tidigare med Wikipedia-artiklarna. Du såg tidigare att det tredje NMF-särdragsvärdet var högt för artiklarna om skådespelarna Anne Hathaway och Denzel Washington. I den här övningen identifierar du ämnet för den motsvarande NMF-komponenten.

NMF-modellen du byggde tidigare finns tillgänglig som model, medan words är en lista med de ord som utgör kolumnetiketterna i ordfrekvensmatrisen.

När du är klar, ta ett ögonblick och fundera på vilket ämne artiklarna om Anne Hathaway och Denzel Washington har gemensamt!

Den här övningen är en del av kursen

Oövervakad inlärning i Python

Visa kurs

Övningsinstruktioner

  • Importera pandas som pd.
  • Skapa en DataFrame components_df från model.components_, och ange columns=words så att kolumnerna får ordbaserade etiketter.
  • Skriv ut components_df.shape för att kontrollera DataFramens dimensioner.
  • Använd .iloc[] på DataFrame:n components_df för att välja rad 3. Tilldela resultatet till component.
  • Anropa metoden .nlargest()component och skriv ut resultatet. Det ger de fem ord som har högst värden för den komponenten.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import pandas
import pandas as pd

# Create a DataFrame: components_df
components_df = ____

# Print the shape of the DataFrame
print(components_df.shape)

# Select row 3: component
component = ____

# Print result of nlargest
print(component.nlargest())
Redigera och kör kod