始める無料で始める

BeautifulSoup を使用した HTML の解析

この演習では、BeautifulSoup パッケージを使って HTML を 解析し、整形し、情報を 抽出 する方法を学びます。Python の生みの親であるグイド・ヴァン・ロッサムのウェブページからデータをスクレイピングしましょう。彼は Python の優しい終身の独裁者 として知られています。次の演習では、HTML を整形し、テキストとハイパーリンクを抽出します。

対象の URL は url = 'https://www.python.org/~guido/' です。

この演習はコースの一部です

Pythonによるデータインポート中級

コースを見る

演習の手順

  • 関数 BeautifulSoup をパッケージ bs4 からインポートします。
  • 対象の URL を変数 url に代入します。
  • requests.get() を使って URL へのリクエストを送信し、レスポンスを変数 r に代入します。
  • オブジェクト rtext 属性を使ってウェブページの HTML を文字列として取得し、変数 html_doc に格納します。
  • 関数 BeautifulSoup() を使って、取得した HTML から BeautifulSoup オブジェクト soup を作成します。
  • prettify() メソッドを soup に適用し、結果を pretty_soup に代入します。
  • 回答を送信して、整形された HTML をシェルに表示しましょう!

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import packages
import requests
from ____ import ____

# Specify url: url


# Package the request, send the request and catch the response: r


# Extracts the response as html: html_doc


# Create a BeautifulSoup object from the HTML: soup


# Prettify the BeautifulSoup object: pretty_soup


# Print the response
print(pretty_soup)
コードを編集して実行