俄羅斯推文的字元數
在這個練習中,給你一個名為 tweets 的資料框,裡面包含一些與俄羅斯網路研究機構(Internet Research Agency)相關、由 FiveThirtyEight 彙整的推文。
你的任務是:在 tweets 中建立一個新的特徵 char_count,用來計算每則推文的字元數。同時,計算推文長度的平均值。推文文字位於 tweets 的 content 特徵中。
請注意,這是來自 Twitter 的真實資料,因此可能包含粗俗或其他具冒犯性的內容(本練習及任何後續同樣使用 Twitter 真實資料的練習皆然)。
本練習屬於課程
Python 中文本特徵工程
練習說明
- 對
tweets的content特徵套用len,建立新特徵char_count。 - 計算並列印
char_count特徵的平均值,以取得推文的平均字元數。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)
# Print the average character count
print(tweets[____].____)