始める無料で始める

あらゆる階層のテキスト

この演習は前のものと似ていますが、指定した要素の複数の世代(子孫)からテキストを選択する点が異なります。

特定の段落要素 p のテキストを取得するために、XPath と CSS Locator の文字列を書きます。HTML 内の p 要素は id 属性が "p3" で一意に定義されています。この情報だけで目的の文字列を作成できるはずですが、参考として、このリンクが属する HTML を含む文字列を変数 html にあらかじめ読み込んであります。必要であれば参照してください。

この演習では、対象の要素内のテキスト、つまり将来世代(子孫)に含まれるすべてのテキストを含めて選択します。どの要素に文字列が向いているかを比較できるよう、print_results 関数を用意しています。

この演習はコースの一部です

Pythonで学ぶWebスクレイピング

コースを見る

演習の手順

  • 変数 xpath には、idp3 の段落要素 p 内のテキスト、すなわちこの p 要素の子孫に含まれるテキストも含めて指し示す XPath 文字列を代入してください。
  • 変数 css_locator には、同じテキストを指し示す CSS Locator 文字列を代入してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create an XPath string to the desired text.
xpath = ____

# Create a CSS Locator string to the desired text.
css_locator = ____

# Print the text from our selections
print_results( xpath, css_locator )
コードを編集して実行