or
Ця вправа є частиною курсу
Вивчіть структуру HTML. Спершу пояснимо, чому вебскрапінг може стати корисним доповненням до ваших інструментів для роботи з даними, а потім розглянемо основи HTML. Наприкінці глави ми коротко познайомимо вас із нотацією XPath, яку використовують для навігації елементами HTML-коду.
Використовуйте синтаксис XPath для роботи з селекторами scrapy. Обидві ці концепції наблизять вас до вміння скрапити HTML-документ.
Вивчіть синтаксис CSS-локаторів і почніть поєднувати CSS-локатори з XPath у ланцюжки. Ми також познайомимося з об'єктами Response, що поводяться як Selectors, але дають додаткові інструменти для масштабування скрапінгу на кількох сайтах.
Поточна вправа
Навчіться створювати вебкроулери за допомогою scrapy. Ці «павуки» scrapy переходитимуть вебсторінками, переходячи за посиланнями й автоматично скраплячи кожну з них за процедурами, які ми вивчили в попередніх главах.