Numărarea cuvintelor (I)
După ce ai înregistrat informațiile de nivel înalt, poți începe să creezi caracteristici bazate pe conținutul efectiv al fiecărui text. O modalitate de a face acest lucru este să abordezi problema similar cu modul în care ai lucrat cu variabilele categoriale în lecțiile anterioare.
- Pentru fiecare cuvânt unic din setul de date se creează o coloană.
- Pentru fiecare intrare, se numără de câte ori apare acel cuvânt, iar valoarea este înregistrată în coloana corespunzătoare.
Aceste coloane de „numărare" pot fi apoi folosite pentru antrenarea modelelor de machine learning.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Importă
CountVectorizerdinsklearn.feature_extraction.text. - Instanțiază
CountVectorizerși atribuie-l variabileicv. - Antrenează vectorizatorul pe coloana
text_clean. - Afișează numele caracteristicilor generate de vectorizator.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)