Začněte nyníZačněte zdarma

Tf-idf

Počty výskytů slov mohou být užitečné při tvorbě modelů, ale slova, která se objevují příliš často, mohou výsledky nežádoucím způsobem zkreslit. Aby tato běžná slova nepřehlušila zbytek modelu, lze použít určitou formu normalizace. V této lekci budeš pracovat s metodou TF-IDF (Term frequency-inverse document frequency), o které jsme mluvili ve videu. TF-IDF snižuje váhu častých slov a naopak zvyšuje váhu slov, která se vyskytují jen v malém počtu dokumentů.

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj TfidfVectorizer z sklearn.feature_extraction.text.
  • Vytvoř instanci TfidfVectorizer s omezením počtu příznaků na 100 a s odstraněním anglických stop slov.
  • Natrénuj vektorizér na sloupci text_clean a zároveň ho aplikuj – v jednom kroku.
  • Vytvoř DataFrame tv_df, který bude obsahovat váhy slov, přičemž názvy příznaků použij jako názvy sloupců.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import TfidfVectorizer
____

# Instantiate TfidfVectorizer
tv = ____

# Fit the vectroizer and transform the data
tv_transformed = ____(speech_df['text_clean'])

# Create a DataFrame with these features
tv_df = pd.DataFrame(tv_transformed.____, 
                     columns=tv.____).add_prefix('TFIDF_')
print(tv_df.head())
Upravit a spustit kód