Làm sạch văn bản của bạn
Dữ liệu văn bản phi cấu trúc không thể dùng trực tiếp trong hầu hết các phân tích. Bạn cần nhiều bước để chuyển từ một chuỗi tự do dài thành một tập các cột số ở đúng định dạng để mô hình machine learning có thể sử dụng. Bước đầu tiên là chuẩn hóa dữ liệu và loại bỏ mọi ký tự có thể gây trục trặc về sau trong pipeline phân tích của bạn.
Trong chương này, bạn sẽ làm việc với một tập dữ liệu mới chứa các bài diễn văn nhậm chức của các tổng thống Hoa Kỳ, đã được nạp dưới tên speech_df, với nội dung bài diễn văn nằm trong cột text.
Bài tập này là một phần của khóa học
Feature Engineering cho Machine Learning bằng Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Print the first 5 rows of the text column
print(____)