Maparea indicilor caracteristicilor la numele lor
În videoclipul lecției, am văzut că CountVectorizer nu indexează neapărat vocabularul în ordine alfabetică. În acest exercițiu, vei învăța să mapezi fiecare indice al unei caracteristici la numele corespunzător din vocabular.
Vom folosi aceleași trei propoziții despre lei din video. Propozițiile sunt disponibile într-o listă numită corpus și au fost deja afișate în consolă.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru NLP în Python
Instrucțiuni pentru exercițiu
- Instanțiază un obiect
CountVectorizer. Numește-lvectorizer. - Folosind
fit_transform(), genereazăbow_matrixpentrucorpus. - Folosind metoda
get_feature_names(), mapează numele coloanelor la cuvântul corespunzător din vocabular.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)