清理文字資料
非結構化的文字資料無法直接用於多數分析。必須經過多個步驟,才能把一段長篇的自由文字,轉成機器學習模型可讀取、格式正確的一組數值欄位。這個流程的第一步,是先標準化資料,並移除任何可能在後續分析流程中造成問題的字元。
在本章中,你會使用一個新的資料集,內容為美國歷任總統的就職演說,已載入為 speech_df,演說內容存放在 text 欄位。
本練習屬於課程
非結構化的文字資料無法直接用於多數分析。必須經過多個步驟,才能把一段長篇的自由文字,轉成機器學習模型可讀取、格式正確的一組數值欄位。這個流程的第一步,是先標準化資料,並移除任何可能在後續分析流程中造成問題的字元。
在本章中,你會使用一個新的資料集,內容為美國歷任總統的就職演說,已載入為 speech_df,演說內容存放在 text 欄位。
本練習屬於課程