Loại bỏ một danh sách cột
Bộ dữ liệu của chúng ta rất phong phú với nhiều đặc trưng, nhưng không phải cái nào cũng hữu ích. Có nhiều cột sẽ rất khó xử lý để biến thành thông tin có giá trị. Trước mắt, hãy loại bỏ các cột chưa hữu dụng ngay bằng cách drop chúng.
'STREETNUMBERNUMERIC': Số địa chỉ bưu chính của ngôi nhà'FIREPLACES': Số lượng lò sưởi trong nhà'LOTSIZEDIMENSIONS': Văn bản tự do mô tả hình dạng lô đất'LISTTYPE': Tập các giá trị kiểu loại hình bán'ACRES': Diện tích lô đất dạng số
Bài tập này là một phần của khóa học
Feature Engineering với PySpark
Hướng dẫn bài tập
- Đọc danh sách mô tả cột ở trên và khám phá 30 giá trị xuất hiện nhiều nhất của chúng bằng
show(), dataframe đã được lọc sẵn theo các cột này làdf - Tạo một danh sách gồm hai cột cần drop vì không liên quan đến việc dự đoán giá nhà, đặt tên là
cols_to_drop. Hãy nhớ rằng máy tính chỉ diễn giải số liệu một cách tường minh và không hiểu ngữ cảnh. - Dùng hàm
drop()để xóa các cột trong danh sáchcols_to_dropkhỏi dataframedf.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)