開始使用免費開始

清理文字資料

非結構化的文字資料無法直接用於多數分析。必須經過多個步驟,才能把一段長篇的自由文字,轉成機器學習模型可讀取、格式正確的一組數值欄位。這個流程的第一步,是先標準化資料,並移除任何可能在後續分析流程中造成問題的字元。

在本章中,你會使用一個新的資料集,內容為美國歷任總統的就職演說,已載入為 speech_df,演說內容存放在 text 欄位。

本練習屬於課程

Feature Engineering for Machine Learning in Python

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Print the first 5 rows of the text column
print(____)
編輯並執行程式碼