Zkoumání textových vektorů, část 2
S využitím funkce return_weights(), kterou jsi napsal(a) v předchozím cvičení, teď z každého dokumentu v textovém vektoru extrahuješ nejdůležitější slova, vrátíš seznam jejich indexů a pomocí tohoto seznamu textový vektor zreduguješ jen na tato slova.
Toto cvičení je součástí kurzu
Preprocessing pro Machine Learning v Pythonu
Pokyny k cvičení
- Zavolej
return_weights(), aby funkce vrátila slova s nejvyšší váhou pro daný dokument. - Zavolej
set()na vrácenýfilter_list, čímž odstraníš duplicitní čísla. - Zavolej
words_to_filters těmito parametry:vocabpro parametrvocab,tfidf_vec.vocabulary_pro parametroriginal_vocab,text_tfidfpro parametrvectora3pro parametrtop_n, čímž z každého dokumentu vezmeš 3 slova s nejvyšší váhou. - Nakonec převeď sadu
filtered_wordsna seznam a použij ho jako filtr pro textový vektor.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
def words_to_filter(vocab, original_vocab, vector, top_n):
filter_list = []
for i in range(0, vector.shape[0]):
# Call the return_weights function and extend filter_list
filtered = ____(vocab, original_vocab, vector, i, top_n)
filter_list.extend(filtered)
# Return the list in a set, so we don't get duplicate word indices
return ____(filter_list)
# Call the function to get the list of word indices
filtered_words = ____(____, ____, ____, ____)
# Filter the columns in text_tfidf to only those in filtered_words
filtered_text = text_tfidf[:, list(____)]