ทำความสะอาดข้อความ
ข้อมูลข้อความที่ไม่มีโครงสร้างไม่สามารถนำไปใช้ในการวิเคราะห์ส่วนใหญ่ได้โดยตรง จำเป็นต้องผ่านหลายขั้นตอนเพื่อแปลงข้อความอิสระที่ยาวให้กลายเป็นชุดคอลัมน์ตัวเลขในรูปแบบที่เหมาะสมสำหรับโมเดล machine learning ขั้นตอนแรกคือการทำให้ข้อมูลเป็นมาตรฐานและกำจัดอักขระที่อาจก่อให้เกิดปัญหาในขั้นตอนต่อไปของ pipeline การวิเคราะห์
ในบทนี้จะได้ทำงานกับชุดข้อมูลใหม่ที่เก็บสุนทรพจน์เปิดตัวของประธานาธิบดีสหรัฐอเมริกา โดยโหลดไว้ในชื่อ speech_df และเก็บข้อความสุนทรพจน์ไว้ในคอลัมน์ text
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering สำหรับ Machine Learning ใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Print the first 5 rows of the text column
print(____)