Response から見破る
秘密のウェブサイトのコンテンツを読み込んだ Response オブジェクト(名前は response)をあらかじめ用意しています。あなたの仕事は、この response 変数を使ってウェブサイトの URL とタイトルを特定することです。URL の見つけ方は前のレッスンで学びました。サイトのタイトルを見つけるには、次のことを知っておく必要があります。
- タイトルは
title要素のテキストです title要素はhead要素の子で、head要素はhtmlルート要素の子です。
補足:html ルート要素には子の head 要素が 1 つだけ、そしてその head 要素には子の title 要素が 1 つだけあります。
この演習はコースの一部です
Pythonで学ぶWebスクレイピング
演習の手順
- 変数
this_urlに、response変数を読み込むために使われた URL を代入してください。 - 変数
this_titleに、response変数を読み込むために使われたウェブサイトのタイトルを代入してください。単一の要素からテキストだけを取得したいので、テキストの抽出にはextract_first()メソッドを使います。 _xpath_ でも _css_ でもかまいませんが、必ず title 要素そのものではなく、その要素内の**テキスト**を選択してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Get the URL to the website loaded in response
this_url = ____
# Get the title of the website loaded in response
this_title = response.____.extract_first()
# Print out our findings
print_url_title( this_url, this_title )