BeautifulSoup으로 웹페이지를 데이터로 변환하기: 텍스트 추출
약속드린 대로, 다음 연습 문제에서는 HTML soup에서 정보를 추출하는 기본기를 배워 볼 거예요. 이 연습 문제에서는 BDFL의 웹페이지에서 텍스트를 추출하고, 웹페이지의 제목을 출력하는 방법을 익혀 봅니다.
이 연습은 강의의 일부입니다
Intermediate Importing Data in Python
연습 안내
- 샘플 코드에서 HTML response object
html_doc는 이미 생성되어 있어요. 먼저BeautifulSoup()함수를 사용해 이를 soup으로 만들고, 결과를 변수soup에 할당하세요. - HTML soup
soup에서title속성을 사용해 제목을 추출하고, 결과를guido_title에 할당하세요. print()함수를 사용해 Guido의 웹페이지 제목을 셸에 출력하세요.- HTML soup
soup에서get_text()메서드로 텍스트를 추출해guido_text에 할당하세요. - Submit을 눌러 Guido의 웹페이지 텍스트를 셸에 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url: url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extract the response as html: html_doc
html_doc = r.text
# Create a BeautifulSoup object from the HTML: soup
# Get the title of Guido's webpage: guido_title
# Print the title of Guido's webpage to the shell
# Get Guido's text: guido_text
# Print Guido's text to the shell
print(guido_text)