多個文字欄位
在這個練習中,你會繼續使用航空公司 Twitter 資料。資料集 tweets 已為你匯入。
在某些情況下,你的資料集中可能有不只一個文字欄位,而且你可能想為每個文字欄位各自建立數值化表示。在這裡,除了包含推文內容的 text 欄位之外,還有第二個文字欄位 negativereason,其中包含顧客留下負面評論的原因。
你的任務是為這兩個欄位都建立 BOW 表示,並指定所需的停用詞。
本練習屬於課程
Python 情感分析
練習說明
- 匯入向量化套件以及英文停用詞的預設清單。
- 更新英文停用詞的預設清單,建立
my_stop_words集合。 - 在第一個向量化器中將停用詞參數指定為更新後的集合,在第二個向量化器中則指定為英文停用詞的預設清單。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import the vectorizer and default English stop words list
____
# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____)
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)
# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())