or
Bài tập này là một phần của khóa học
Trong chương này, bạn sẽ khám phá feature engineering là gì và cách bắt đầu áp dụng nó vào dữ liệu thực tế. Bạn sẽ tải, khám phá và trực quan hóa một bộ dữ liệu phản hồi khảo sát; qua đó, bạn sẽ tìm hiểu về các kiểu dữ liệu cơ bản và vì sao chúng ảnh hưởng đến cách bạn nên xây dựng đặc trưng. Sử dụng gói pandas, bạn sẽ tạo đặc trưng mới từ cả các cột phân loại và liên tục.
Chương này giới thiệu với bạn thực tế về dữ liệu lộn xộn và không đầy đủ. Bạn sẽ học cách tìm các giá trị thiếu trong dữ liệu và khám phá nhiều cách tiếp cận để xử lý chúng. Bạn cũng sẽ dùng các kỹ thuật thao tác chuỗi để loại bỏ các ký tự không mong muốn trong bộ dữ liệu.
Trong chương này, bạn sẽ tập trung phân tích phân phối cơ bản của dữ liệu và liệu nó có ảnh hưởng đến quy trình Machine Learning của bạn hay không. Bạn sẽ học cách xử lý dữ liệu lệch và các trường hợp ngoại lệ có thể tác động tiêu cực đến phân tích.
Cuối cùng, trong chương này, bạn sẽ làm việc với dữ liệu văn bản phi cấu trúc, tìm hiểu cách trích xuất và xây dựng các đặc trưng dạng cột từ một corpus văn bản. Bạn sẽ so sánh cách các phương pháp khác nhau ảnh hưởng đến lượng ngữ cảnh được trích xuất từ văn bản, và cách cân bằng nhu cầu về ngữ cảnh mà không tạo ra quá nhiều đặc trưng.
Bài tập hiện tại