在這個練習中,你會拿到四個資料框 df1、df2、df3 和 df4。每個資料框的最後一欄是預測目標變數,其餘欄位是訓練特徵。
df1
df2
df3
df4
請在主控台中判斷,哪一個資料框的格式適合用來訓練分類器。
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
學習計算基本特徵,如單字數、字元數、平均單字長度,以及特殊字元數(例如 Twitter 的主題標籤與提及)。你也會學習計算可讀性分數,並判斷理解一段文字所需的教育程度。
當前練習
在本章中,你將學到斷詞(tokenization)與詞形還原(lemmatization)。接著你會學習如何使用 spaCy 函式庫進行文字清理、詞性標註與命名實體辨識。掌握這些觀念後,你將把蓋茨堡演說轉為適合機器處理的格式、分析假新聞中的名詞用法,並找出 TechCrunch 文章中被提及的人物。
學習 n-gram 建模,並用它來對電影評論進行情緒分析。
學習如何計算 tf-idf 權重,以及兩個向量之間的餘弦相似度分數。你將運用這些概念建立電影與 TED Talk 推薦系統。最後,你也會認識詞嵌入,並使用詞向量表示法來計算多首 Pink Floyd 歌曲之間的相似度。