Začněte nyníZačněte zdarma

Hledání nejčastějších slov

Po vytvoření příznaků je vždy dobré je prohlédnout a ověřit, že odpovídají tvým očekáváním. Díky tomu zachytíš chyby včas a možná zjistíš, jaké další úpravy příznaků bude potřeba provést.

Ve svém pracovním prostoru máš k dispozici vektorizátor (cv), který jsi natrénoval/a v předchozím cvičení, a řídké pole s počty slov (cv_trigram).

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř DataFrame příznaků (počtů slov).
  • Sečti výskyty jednotlivých slov a vypiš 5 nejčastěji se vyskytujících.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a DataFrame of the features
cv_tri_df = ____(____, 
                 columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')

# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())
Upravit a spustit kód