상위 수준 텍스트 특성
텍스트를 정리하고 표준화한 후에는 데이터에서 특성을 만들 수 있어요. 자유 형식 텍스트에 대해 계산할 수 있는 가장 기본 정보는 길이와 단어 수처럼 크기와 관련된 값입니다. 이 연습 문제(그리고 이 장의 나머지 문제)에서는 이전 연습 문제에서 만든 정리/변환된 텍스트 열(text_clean)에 집중할 거예요.
이 연습은 강의의 일부입니다
Python으로 배우는 Machine Learning 특성 공학
연습 안내
- 각 연설문의 문자 길이를
char_count열에 기록하세요. - 각 연설문의 단어 수를
word_count열에 기록하세요. - 각 연설문의 평균 단어 길이를
avg_word_length열에 기록하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])