Začněte nyníZačněte zdarma

Zkoumání textových vektorů, část 1

Pojďme rozšířit metodu průzkumu textových vektorů, kterou jsme si právě ukázali, tentokrát s využitím tf/idf vektorů sloupce title z datasetu volunteer. V této první části se zaměříme na rozšíření funkce z prezentace – funkce bude vracet seznam čísel. V dalším cvičení napíšeme další funkci, která shromáždí nejdůležitější slova ze všech dokumentů, extrahuje je a použije je k filtrování vektoru text_tfidf.

Toto cvičení je součástí kurzu

Preprocessing pro Machine Learning v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Přidej parametry original_vocab pro tfidf_vec.vocabulary_ a top_n.
  • Zavolej pd.Series() na zazipovaný slovník – díky tomu bude snazší s ním pracovat.
  • Pomocí funkce .sort_values() seřaď sérii a ořízni index na top_n slov.
  • Zavolej funkci s argumenty original_vocab=tfidf_vec.vocabulary_, vector_index=8 pro výběr 9. řádku a top_n=3 pro získání 3 nejvýše ohodnocených slov.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Add in the rest of the arguments
def return_weights(vocab, ____, vector, vector_index, ____):
    zipped = dict(zip(vector[vector_index].indices, vector[vector_index].data))
    
    # Transform that zipped dict into a series
    zipped_series = ____({vocab[i]:zipped[i] for i in vector[vector_index].indices})
    
    # Sort the series to pull out the top n weighted words
    zipped_index = zipped_series.____(ascending=False)[:____].index
    return [original_vocab[i] for i in zipped_index]

# Print out the weighted words
print(return_weights(vocab, ____, text_tfidf, ____, ____))
Upravit a spustit kód