시작하기무료로 시작하기

BeautifulSoup으로 웹페이지를 데이터로 변환하기: 텍스트 추출

약속드린 대로, 다음 연습 문제에서는 HTML soup에서 정보를 추출하는 기본기를 배워 볼 거예요. 이 연습 문제에서는 BDFL의 웹페이지에서 텍스트를 추출하고, 웹페이지의 제목을 출력하는 방법을 익혀 봅니다.

이 연습은 강의의 일부입니다

Intermediate Importing Data in Python

강의 보기

연습 안내

  • 샘플 코드에서 HTML response object html_doc는 이미 생성되어 있어요. 먼저 BeautifulSoup() 함수를 사용해 이를 soup으로 만들고, 결과를 변수 soup에 할당하세요.
  • HTML soup soup에서 title 속성을 사용해 제목을 추출하고, 결과를 guido_title에 할당하세요.
  • print() 함수를 사용해 Guido의 웹페이지 제목을 셸에 출력하세요.
  • HTML soup soup에서 get_text() 메서드로 텍스트를 추출해 guido_text에 할당하세요.
  • Submit을 눌러 Guido의 웹페이지 텍스트를 셸에 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url: url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extract the response as html: html_doc
html_doc = r.text

# Create a BeautifulSoup object from the HTML: soup


# Get the title of Guido's webpage: guido_title


# Print the title of Guido's webpage to the shell


# Get Guido's text: guido_text


# Print Guido's text to the shell
print(guido_text)
코드 편집 및 실행