Mapování indexů příznaků na jejich názvy
Ve videu jsme viděli, že CountVectorizer neindexuje slovník nutně v abecedním pořadí. V tomto cvičení se naučíš, jak přiřadit každý index příznaku odpovídajícímu slovu ze slovníku.
Použijeme stejné tři věty o lvech z videa. Věty jsou dostupné v seznamu corpus a byly již vypsány do konzole.
Toto cvičení je součástí kurzu
Feature Engineering for NLP in Python
Pokyny k cvičení
- Vytvoř instanci objektu
CountVectorizera pojmenuj jivectorizer. - Pomocí
fit_transform()vygenerujbow_matrixprocorpus. - Pomocí metody
get_feature_names()namapuj názvy sloupců na odpovídající slova ze slovníku.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)