レッスンでは、DataCampのコース「Introduction to R」のコースタイトル要素を「要素を検証」したときの次のスクリーンショットを簡単に見ました。
この画像に示されているソース(HTML)コードを確認し、選択したコースのタイトルテキストを含むh4要素のclass属性として、次のうちどれが一致するか選んでください。
h4
class
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
HTMLの構造を学びます。まず、Webスクレイピングがデータサイエンスの道具箱にとって有用である理由を説明し、HTMLの基礎に踏み込みます。章の最後には、HTMLコード内の要素をたどるために使うXPath表記の概要を紹介します。
XPathの文法を活用してscrapyのセレクターを探ります。これらの概念を理解することで、HTMLドキュメントをスクレイピングできるようになります。
現在の演習
CSSロケーターの文法を学び、CSSロケーターをXPathと連結して使う発想に触れます。さらに、セレクターのように振る舞いつつ、複数サイトにまたがるスクレイピングを進めるための追加機能を備えたResponseオブジェクトも紹介します。
scrapyでウェブクローラーを作成する方法を学びます。これらのscrapyスパイダーは、前章までに学んだ手順に従ってリンクをたどり、複数ページにわたって自動的にスクレイピングします。