開始使用免費開始

多個文字欄位

在這個練習中,你會繼續使用航空公司 Twitter 資料。資料集 tweets 已為你匯入。

在某些情況下,你的資料集中可能有不只一個文字欄位,而且你可能想為每個文字欄位各自建立數值化表示。在這裡,除了包含推文內容的 text 欄位之外,還有第二個文字欄位 negativereason,其中包含顧客留下負面評論的原因。

你的任務是為這兩個欄位都建立 BOW 表示,並指定所需的停用詞。

本練習屬於課程

Python 情感分析

檢視課程

練習說明

  • 匯入向量化套件以及英文停用詞的預設清單。
  • 更新英文停用詞的預設清單,建立 my_stop_words 集合。
  • 在第一個向量化器中將停用詞參數指定為更新後的集合,在第二個向量化器中則指定為英文停用詞的預設清單。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import the vectorizer and default English stop words list
____

# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
 
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____) 
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)

# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())
編輯並執行程式碼