開始使用免費開始

以特徵名稱對應特徵索引

在課程影片中,我們看到 CountVectorizer 不一定會依字母順序為詞彙建立索引。這個練習中,你會學到如何把每個特徵索引,對應到詞彙表中的特徵名稱。

我們會使用影片中的同三個有關獅子的句子。這些句子已放在名為 corpus 的清單中,並已經列印到主控台。

本練習屬於課程

Python 中文本特徵工程

檢視課程

練習說明

  • 建立一個 CountVectorizer 物件,命名為 vectorizer
  • 使用 fit_transform(),為 corpus 產生 bow_matrix
  • 使用 get_feature_names() 方法,將欄名對應到詞彙表中的相應單字。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
編輯並執行程式碼