ハイパー(リンク)アクティブ
"web-crawling" において最も重要な属性のひとつは、a タグ内のハイパーリンク URL(href 属性)です。ここでは、そのハイパーリンクを抽出します。print_attribute 関数は、あなたの XPath で抽出したデータを表示するために用意しています。コンソールで XPath 文字列を試すこともできます。
この演習は次の HTML ソースコードを参照します:
<html>
<body>
<div id="div1" class="class-1">
<p class="class-1 class-2">Hello World!</p>
<div id="div2">
<p id="p2" class="class-2">Choose
<a href="http://datacamp.com">DataCamp!</a>!
</p>
</div>
</div>
<div id="div3" class="class-2">
<p class="class-2">Thanks for Watching!</p>
</div>
</body>
</html>
この演習はコースの一部です
Pythonで学ぶWebスクレイピング
演習の手順
- 空欄を埋めて、DataCamp のハイパーリンクから
href属性値を選択する変数xpathを完成させてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'
# Print out the selection(s); there should be only one
print_attribute( xpath )