Tf-idf
Počty výskytů slov mohou být užitečné při tvorbě modelů, ale slova, která se objevují příliš často, mohou výsledky nežádoucím způsobem zkreslit. Aby tato běžná slova nepřehlušila zbytek modelu, lze použít určitou formu normalizace. V této lekci budeš pracovat s metodou TF-IDF (Term frequency-inverse document frequency), o které jsme mluvili ve videu. TF-IDF snižuje váhu častých slov a naopak zvyšuje váhu slov, která se vyskytují jen v malém počtu dokumentů.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Pokyny k cvičení
- Importuj
TfidfVectorizerzsklearn.feature_extraction.text. - Vytvoř instanci
TfidfVectorizers omezením počtu příznaků na 100 a s odstraněním anglických stop slov. - Natrénuj vektorizér na sloupci
text_cleana zároveň ho aplikuj – v jednom kroku. - Vytvoř DataFrame
tv_df, který bude obsahovat váhy slov, přičemž názvy příznaků použij jako názvy sloupců.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import TfidfVectorizer
____
# Instantiate TfidfVectorizer
tv = ____
# Fit the vectroizer and transform the data
tv_transformed = ____(speech_df['text_clean'])
# Create a DataFrame with these features
tv_df = pd.DataFrame(tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(tv_df.head())