始める無料で始める

Response から見破る

秘密のウェブサイトのコンテンツを読み込んだ Response オブジェクト(名前は response)をあらかじめ用意しています。あなたの仕事は、この response 変数を使ってウェブサイトの URL とタイトルを特定することです。URL の見つけ方は前のレッスンで学びました。サイトのタイトルを見つけるには、次のことを知っておく必要があります。

  • タイトルは title 要素のテキストです
  • title 要素は head 要素の子で、head 要素は html ルート要素の子です。

補足:html ルート要素には子の head 要素が 1 つだけ、そしてその head 要素には子の title 要素が 1 つだけあります。

この演習はコースの一部です

Pythonで学ぶWebスクレイピング

コースを見る

演習の手順

  • 変数 this_url に、response 変数を読み込むために使われた URL を代入してください。
  • 変数 this_title に、response 変数を読み込むために使われたウェブサイトのタイトルを代入してください。単一の要素からテキストだけを取得したいので、テキストの抽出には extract_first() メソッドを使います。
  • _xpath_ でも _css_ でもかまいませんが、必ず title 要素そのものではなく、その要素内の**テキスト**を選択してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Get the URL to the website loaded in response
this_url = ____

# Get the title of the website loaded in response
this_title = response.____.extract_first()

# Print out our findings
print_url_title( this_url, this_title )
コードを編集して実行