Začněte nyníZačněte zdarma

Zkoumání textových vektorů, část 2

S využitím funkce return_weights(), kterou jsi napsal(a) v předchozím cvičení, teď z každého dokumentu v textovém vektoru extrahuješ nejdůležitější slova, vrátíš seznam jejich indexů a pomocí tohoto seznamu textový vektor zreduguješ jen na tato slova.

Toto cvičení je součástí kurzu

Preprocessing pro Machine Learning v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Zavolej return_weights(), aby funkce vrátila slova s nejvyšší váhou pro daný dokument.
  • Zavolej set() na vrácený filter_list, čímž odstraníš duplicitní čísla.
  • Zavolej words_to_filter s těmito parametry: vocab pro parametr vocab, tfidf_vec.vocabulary_ pro parametr original_vocab, text_tfidf pro parametr vector a 3 pro parametr top_n, čímž z každého dokumentu vezmeš 3 slova s nejvyšší váhou.
  • Nakonec převeď sadu filtered_words na seznam a použij ho jako filtr pro textový vektor.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

def words_to_filter(vocab, original_vocab, vector, top_n):
    filter_list = []
    for i in range(0, vector.shape[0]):
    
        # Call the return_weights function and extend filter_list
        filtered = ____(vocab, original_vocab, vector, i, top_n)
        filter_list.extend(filtered)
        
    # Return the list in a set, so we don't get duplicate word indices
    return ____(filter_list)

# Call the function to get the list of word indices
filtered_words = ____(____, ____, ____, ____)

# Filter the columns in text_tfidf to only those in filtered_words
filtered_text = text_tfidf[:, list(____)]
Upravit a spustit kód