शुरू करेंमुफ़्त में शुरू करें

BeautifulSoup के साथ HTML पार्स करना

इस इंटरैक्टिव अभ्यास में, आप सीखेंगे कि BeautifulSoup पैकेज का उपयोग करके HTML से जानकारी को parse करना, prettify करना और extract करना कैसे किया जाता है. आप Guido van Rossum की वेबपेज से डेटा स्क्रैप करेंगे, जो Python के Benevolent Dictator for Life रहे हैं. आने वाले अभ्यासों में, आप HTML को प्रीटिफाई करेंगे और फिर टेक्स्ट व हाइपरलिंक निकालेंगे.

रुचि का URL है url = 'https://www.python.org/~guido/'.

यह अभ्यास पाठ्यक्रम का हिस्सा है

इंटरमीडिएट Importing Data in Python

पाठ्यक्रम देखें

अभ्यास निर्देश

  • पैकेज bs4 से फंक्शन BeautifulSoup इम्पोर्ट करें.
  • रुचि वाले URL को वैरिएबल url में असाइन करें.
  • URL के लिए रिक्वेस्ट तैयार करें, रिक्वेस्ट भेजें और एक ही फंक्शन requests.get() से रिस्पॉन्स कैच करें; रिस्पॉन्स को वैरिएबल r में असाइन करें.
  • ऑब्जेक्ट r के text एट्रिब्यूट का उपयोग करके वेबपेज का HTML स्ट्रिंग के रूप में प्राप्त करें; परिणाम को वैरिएबल html_doc में स्टोर करें.
  • प्राप्त HTML से फंक्शन BeautifulSoup() द्वारा एक BeautifulSoup ऑब्जेक्ट soup बनाएँ.
  • soup पर prettify() मेथड का उपयोग करें और परिणाम को pretty_soup में असाइन करें.
  • अपने शेल में प्रीटिफाइड HTML प्रिंट कराने के लिए Submit Answer दबाएँ!

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import packages
import requests
from ____ import ____

# Specify url: url


# Package the request, send the request and catch the response: r


# Extracts the response as html: html_doc


# Create a BeautifulSoup object from the HTML: soup


# Prettify the BeautifulSoup object: pretty_soup


# Print the response
print(pretty_soup)
कोड संपादित करें और चलाएँ