Ознаки високого рівня для тексту
Коли текст очищено й стандартизовано, можна починати створювати ознаки з даних. Найбазовіша інформація, яку можна обчислити для вільного тексту, — це його розмір: довжина та кількість слів. У цій вправі (і далі в розділі) ви зосередитеся на очищеному/перетвореному стовпці тексту (text_clean), який ви створили в попередній вправі.
Ця вправа є частиною курсу
Feature Engineering для машинного навчання в Python
Інструкції до вправи
- Запишіть кількість символів кожного виступу в стовпці
char_count. - Запишіть кількість слів кожного виступу в стовпці
word_count. - Запишіть середню довжину слова для кожного виступу в стовпці
avg_word_length.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])