ÎncepețiÎncepe gratuit

Maparea indicilor caracteristicilor la numele lor

În videoclipul lecției, am văzut că CountVectorizer nu indexează neapărat vocabularul în ordine alfabetică. În acest exercițiu, vei învăța să mapezi fiecare indice al unei caracteristici la numele corespunzător din vocabular.

Vom folosi aceleași trei propoziții despre lei din video. Propozițiile sunt disponibile într-o listă numită corpus și au fost deja afișate în consolă.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru NLP în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Instanțiază un obiect CountVectorizer. Numește-l vectorizer.
  • Folosind fit_transform(), generează bow_matrix pentru corpus.
  • Folosind metoda get_feature_names(), mapează numele coloanelor la cuvântul corespunzător din vocabular.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
Editează și rulează codul