yon11b

크롤링 본문

개발/기타

크롤링

yon11b 2022. 1. 13. 19:30
반응형

동아리에서 크롤링을 이용한 웹사이트 제작 스터디가 며칠 전에 끝났다.

그래서 크롤링에 관해 정리해보려고 한다. 

 

설치

명령어 창을 켜고 다음 명령어를 입력하자.

pip install requests
pip install beautifulsoup4

requests는 웹 페이지에 HTTP 요청 기능을 제공하는 파이썬 라이브러리이고

beautifulsoup는 HTML/XML 에서 데이터를 추출할 수 있는 기능을 제공하는 파이썬 라이브러리 이다.

 

사용

import requests
from bs4 import BeatifulSoup #S는 대문자

 실습: 위키에서 web 검색했을 때 목록 가져오기

저기 있는 목록들을 가져와보자

 

import requests
from bs4 import BeautifulSoup
response=requests.request('GET','https://en.wikipedia.org/wiki/World_Wide_Web')
print(response)
soup=BeautifulSoup(response.content,'html.parser')
print(soup.find_all('span',class_='toctext'))

태그까지 같이 불러왔다.

.get_text()을 사용하여 글자만 불러오도록 하자.

import requests
from bs4 import BeautifulSoup
response=requests.request('GET','https://en.wikipedia.org/wiki/World_Wide_Web')
print(response)
soup=BeautifulSoup(response.content,'html.parser')
lists=soup.find_all('span',class_='toctext')
for list in lists:
    print(list.get_text())

 

숫자가 있는 게 더 보기 좋을 것 같다.

import requests
from bs4 import BeautifulSoup
response=requests.request('GET','https://en.wikipedia.org/wiki/World_Wide_Web')
print(response)
LIST=[]
soup=BeautifulSoup(response.content,'html.parser')

lists=soup.find_all('li',class_='toclevel-1')
for list in lists:
    section=''
    for level in list.get_text():
        section+=level
    print(section)

728x90