NMF identifică topicele documentelor
În lecția video, ai văzut că atunci când NMF este aplicat pe documente, componentele corespund topicelor acestora, iar caracteristicile NMF reconstruiesc documentele pe baza topicelor. Verifică acest lucru pe modelul NMF construit anterior folosind articolele Wikipedia. Anterior, ai observat că a 3-a valoare a caracteristicii NMF era ridicată pentru articolele despre actorii Anne Hathaway și Denzel Washington. În acest exercițiu, identifică topicul componentei NMF corespunzătoare.
Modelul NMF construit anterior este disponibil ca model, iar words este o listă cu cuvintele care etichetează coloanele matricei de frecvențe a cuvintelor.
După ce termini, ia un moment să recunoști topicul pe care îl au în comun articolele despre Anne Hathaway și Denzel Washington!
Acest exercițiu face parte din cursul
Învățare nesupervizată în Python
Instrucțiuni pentru exercițiu
- Importă
pandascapd. - Creează un DataFrame
components_dfdinmodel.components_, setândcolumns=wordsastfel încât coloanele să fie etichetate cu cuvintele. - Afișează
components_df.shapepentru a verifica dimensiunile DataFrame-ului. - Folosește accessorul
.iloc[]pe DataFrame-ulcomponents_dfpentru a selecta rândul3. Atribuie rezultatul variabileicomponent. - Apelează metoda
.nlargest()pecomponentși afișează rezultatul. Aceasta returnează cele cinci cuvinte cu cele mai mari valori pentru acea componentă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import pandas
import pandas as pd
# Create a DataFrame: components_df
components_df = ____
# Print the shape of the DataFrame
print(components_df.shape)
# Select row 3: component
component = ____
# Print result of nlargest
print(component.nlargest())