Tf-idf
Zliczanie wystąpień słów może być przydatne przy budowaniu modeli, jednak słowa pojawiające się bardzo często mogą niepożądanie zaburzać wyniki. Aby ograniczyć wpływ takich popularnych słów na model, można zastosować normalizację. W tym ćwiczeniu skorzystasz z metody TF-IDF (Term Frequency-Inverse Document Frequency), omówionej w materiale wideo. TF-IDF zmniejsza wagę słów często występujących w korpusie, jednocześnie zwiększając znaczenie słów rzadkich, pojawiających się tylko w nielicznych dokumentach.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
TfidfVectorizerz bibliotekisklearn.feature_extraction.text. - Utwórz instancję
TfidfVectorizer, ograniczając liczbę cech do 100 i usuwając angielskie stop words. - Dopasuj i zastosuj wektoryzator na kolumnie
text_cleanw jednym kroku. - Utwórz DataFrame
tv_dfzawierający wagi słów, używając nazw cech jako nazw kolumn.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import TfidfVectorizer
____
# Instantiate TfidfVectorizer
tv = ____
# Fit the vectroizer and transform the data
tv_transformed = ____(speech_df['text_clean'])
# Create a DataFrame with these features
tv_df = pd.DataFrame(tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(tv_df.head())