始める無料で始める

ハイレベルなテキスト特徴量

テキストをクリーンアップして標準化したら、そこから特徴量を作成できます。自由記述のテキストについて計算できる最も基本的な情報は、その大きさ(文字数や単語数)です。本演習(およびこの章の残り)では、前の演習で作成したクリーン/変換済みテキスト列(text_clean)に注目します。

この演習はコースの一部です

Python で学ぶ Machine Learning のための特徴量エンジニアリング

コースを見る

演習の手順

  • 各スピーチの文字数を char_count 列に記録します。
  • 各スピーチの単語数を word_count 列に記録します。
  • 各スピーチの平均単語長を avg_word_length 列に記録します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____

# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____

# Find the average length of word
speech_df['avg_word_length'] = ____ / ____

# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])
コードを編集して実行