BeautifulSoup के साथ HTML पार्स करना
इस इंटरैक्टिव अभ्यास में, आप सीखेंगे कि BeautifulSoup पैकेज का उपयोग करके HTML से जानकारी को parse करना, prettify करना और extract करना कैसे किया जाता है. आप Guido van Rossum की वेबपेज से डेटा स्क्रैप करेंगे, जो Python के Benevolent Dictator for Life रहे हैं. आने वाले अभ्यासों में, आप HTML को प्रीटिफाई करेंगे और फिर टेक्स्ट व हाइपरलिंक निकालेंगे.
रुचि का URL है url = 'https://www.python.org/~guido/'.
यह अभ्यास पाठ्यक्रम का हिस्सा है
इंटरमीडिएट Importing Data in Python
अभ्यास निर्देश
- पैकेज
bs4से फंक्शनBeautifulSoupइम्पोर्ट करें. - रुचि वाले URL को वैरिएबल
urlमें असाइन करें. - URL के लिए रिक्वेस्ट तैयार करें, रिक्वेस्ट भेजें और एक ही फंक्शन
requests.get()से रिस्पॉन्स कैच करें; रिस्पॉन्स को वैरिएबलrमें असाइन करें. - ऑब्जेक्ट
rकेtextएट्रिब्यूट का उपयोग करके वेबपेज का HTML स्ट्रिंग के रूप में प्राप्त करें; परिणाम को वैरिएबलhtml_docमें स्टोर करें. - प्राप्त HTML से फंक्शन
BeautifulSoup()द्वारा एक BeautifulSoup ऑब्जेक्टsoupबनाएँ. soupपरprettify()मेथड का उपयोग करें और परिणाम कोpretty_soupमें असाइन करें.- अपने शेल में प्रीटिफाइड HTML प्रिंट कराने के लिए Submit Answer दबाएँ!
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import packages
import requests
from ____ import ____
# Specify url: url
# Package the request, send the request and catch the response: r
# Extracts the response as html: html_doc
# Create a BeautifulSoup object from the HTML: soup
# Prettify the BeautifulSoup object: pretty_soup
# Print the response
print(pretty_soup)