ПочатиПочніть безкоштовно

Ознаки високого рівня для тексту

Коли текст очищено й стандартизовано, можна починати створювати ознаки з даних. Найбазовіша інформація, яку можна обчислити для вільного тексту, — це його розмір: довжина та кількість слів. У цій вправі (і далі в розділі) ви зосередитеся на очищеному/перетвореному стовпці тексту (text_clean), який ви створили в попередній вправі.

Ця вправа є частиною курсу

Feature Engineering для машинного навчання в Python

Переглянути курс

Інструкції до вправи

  • Запишіть кількість символів кожного виступу в стовпці char_count.
  • Запишіть кількість слів кожного виступу в стовпці word_count.
  • Запишіть середню довжину слова для кожного виступу в стовпці avg_word_length.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____

# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____

# Find the average length of word
speech_df['avg_word_length'] = ____ / ____

# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])
Редагувати та запускати код