or
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
เรียนรู้โครงสร้างของ HTML เริ่มต้นด้วยการอธิบายว่าเหตุใด web scraping จึงเป็นทักษะที่มีประโยชน์ในการทำงาน data science จากนั้นเจาะลึกพื้นฐานของ HTML และปิดท้ายบทด้วยการแนะนำ XPath notation ซึ่งใช้สำหรับนำทางภายในองค์ประกอบต่าง ๆ ของโค้ด HTML
ใช้ syntax ของ XPath เพื่อสำรวจ scrapy selector ทั้งสองแนวคิดนี้จะช่วยให้พร้อมสำหรับการ scrape เอกสาร HTML ได้อย่างมีประสิทธิภาพ
แบบฝึกหัดปัจจุบัน
เรียนรู้ syntax ของ CSS Locator และเริ่มทดลองเชื่อมต่อ CSS Locator กับ XPath เข้าด้วยกัน พร้อมทั้งแนะนำ Response object ซึ่งทำงานคล้าย Selector แต่มีเครื่องมือเพิ่มเติมที่ช่วยขยายการ scraping ไปยังหลายเว็บไซต์ได้
เรียนรู้การสร้าง web crawler ด้วย scrapy โดย scrapy spider เหล่านี้จะ crawl เว็บผ่านหลายหน้า ติดตามลิงก์เพื่อ scrape แต่ละหน้าโดยอัตโนมัติตามกระบวนการที่ได้เรียนรู้ในบทก่อนหน้า