or
Bài tập này là một phần của khóa học
Tìm hiểu cấu trúc của HTML. Chúng ta bắt đầu bằng việc giải thích vì sao web scraping là một bổ sung giá trị cho bộ công cụ khoa học dữ liệu của bạn, rồi đi vào các kiến thức cơ bản về HTML. Cuối chương, chúng ta sẽ giới thiệu ngắn gọn về cú pháp XPath, dùng để điều hướng các phần tử trong mã HTML.
Bài tập hiện tại
Tận dụng cú pháp XPath để khám phá selector của scrapy. Cả hai khái niệm này sẽ giúp bạn tiến tới khả năng trích xuất dữ liệu từ một tài liệu HTML.
Học cú pháp CSS Locator và bắt đầu thực hành kết hợp (chaining) CSS Locator với XPath. Chúng ta cũng giới thiệu đối tượng Response, hoạt động tương tự Selector nhưng cung cấp thêm công cụ để mở rộng việc scraping trên nhiều website.
Học cách tạo trình thu thập dữ liệu web với scrapy. Các spider scrapy này sẽ lần theo nhiều trang, theo các liên kết để tự động trích xuất dữ liệu trên từng trang theo các quy trình bạn đã học ở các chương trước.