Hledání nejčastějších slov
Po vytvoření příznaků je vždy dobré je prohlédnout a ověřit, že odpovídají tvým očekáváním. Díky tomu zachytíš chyby včas a možná zjistíš, jaké další úpravy příznaků bude potřeba provést.
Ve svém pracovním prostoru máš k dispozici vektorizátor (cv), který jsi natrénoval/a v předchozím cvičení, a řídké pole s počty slov (cv_trigram).
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Pokyny k cvičení
- Vytvoř DataFrame příznaků (počtů slov).
- Sečti výskyty jednotlivých slov a vypiš 5 nejčastěji se vyskytujících.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a DataFrame of the features
cv_tri_df = ____(____,
columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')
# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())