Začněte nyníZačněte zdarma

Mapování indexů příznaků na jejich názvy

Ve videu jsme viděli, že CountVectorizer neindexuje slovník nutně v abecedním pořadí. V tomto cvičení se naučíš, jak přiřadit každý index příznaku odpovídajícímu slovu ze slovníku.

Použijeme stejné tři věty o lvech z videa. Věty jsou dostupné v seznamu corpus a byly již vypsány do konzole.

Toto cvičení je součástí kurzu

Feature Engineering for NLP in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř instanci objektu CountVectorizer a pojmenuj ji vectorizer.
  • Pomocí fit_transform() vygeneruj bow_matrix pro corpus.
  • Pomocí metody get_feature_names() namapuj názvy sloupců na odpovídající slova ze slovníku.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
Upravit a spustit kód