NMF odkrywa tematy dokumentów
W filmie dowiedziałeś się, że gdy NMF jest stosowany do dokumentów, składowe odpowiadają ich tematom, a cechy NMF pozwalają odtworzyć dokumenty z tych tematów. Sprawdź to samodzielnie na modelu NMF zbudowanym wcześniej na podstawie artykułów z Wikipedii. Poprzednio widziałeś, że 3. wartość cechy NMF była wysoka dla artykułów o aktorach Anne Hathaway i Denzelu Washingtonie. W tym ćwiczeniu określ temat odpowiadającej tej cesze składowej NMF.
Model NMF zbudowany wcześniej jest dostępny jako model, natomiast words to lista słów opisujących kolumny tablicy częstości słów.
Po ukończeniu ćwiczenia zastanów się, jaki temat łączy artykuły o Anne Hathaway i Denzelu Washingtonie!
To ćwiczenie jest częścią kursu
Uczenie nienadzorowane w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
pandasjakopd. - Utwórz DataFrame
components_dfzmodel.components_, ustawiająccolumns=words, aby kolumny były opisane słowami. - Wyświetl
components_df.shape, aby sprawdzić wymiary DataFrame. - Użyj akcesora
.iloc[]na DataFramecomponents_df, aby wybrać wiersz3. Przypisz wynik do zmiennejcomponent. - Wywołaj metodę
.nlargest()nacomponenti wyświetl wynik. Zwróci ona pięć słów o najwyższych wartościach dla tej składowej.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import pandas
import pandas as pd
# Create a DataFrame: components_df
components_df = ____
# Print the shape of the DataFrame
print(components_df.shape)
# Select row 3: component
component = ____
# Print result of nlargest
print(component.nlargest())