Zkoumání textových vektorů, část 1
Pojďme rozšířit metodu průzkumu textových vektorů, kterou jsme si právě ukázali, tentokrát s využitím tf/idf vektorů sloupce title z datasetu volunteer. V této první části se zaměříme na rozšíření funkce z prezentace – funkce bude vracet seznam čísel. V dalším cvičení napíšeme další funkci, která shromáždí nejdůležitější slova ze všech dokumentů, extrahuje je a použije je k filtrování vektoru text_tfidf.
Toto cvičení je součástí kurzu
Preprocessing pro Machine Learning v Pythonu
Pokyny k cvičení
- Přidej parametry
original_vocabprotfidf_vec.vocabulary_atop_n. - Zavolej
pd.Series()na zazipovaný slovník – díky tomu bude snazší s ním pracovat. - Pomocí funkce
.sort_values()seřaď sérii a ořízni index natop_nslov. - Zavolej funkci s argumenty
original_vocab=tfidf_vec.vocabulary_,vector_index=8pro výběr 9. řádku atop_n=3pro získání 3 nejvýše ohodnocených slov.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Add in the rest of the arguments
def return_weights(vocab, ____, vector, vector_index, ____):
zipped = dict(zip(vector[vector_index].indices, vector[vector_index].data))
# Transform that zipped dict into a series
zipped_series = ____({vocab[i]:zipped[i] for i in vector[vector_index].indices})
# Sort the series to pull out the top n weighted words
zipped_index = zipped_series.____(ascending=False)[:____].index
return [original_vocab[i] for i in zipped_index]
# Print out the weighted words
print(return_weights(vocab, ____, text_tfidf, ____, ____))