ハイレベルなテキスト特徴量
テキストをクリーンアップして標準化したら、そこから特徴量を作成できます。自由記述のテキストについて計算できる最も基本的な情報は、その大きさ(文字数や単語数)です。本演習(およびこの章の残り)では、前の演習で作成したクリーン/変換済みテキスト列(text_clean)に注目します。
この演習はコースの一部です
Python で学ぶ Machine Learning のための特徴量エンジニアリング
演習の手順
- 各スピーチの文字数を
char_count列に記録します。 - 各スピーチの単語数を
word_count列に記録します。 - 各スピーチの平均単語長を
avg_word_length列に記録します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])