816 B
816 B
项目实战:爬虫入门
学习目标
- 了解爬虫的基本原理
- 掌握 requests 库的使用
- 学会使用 BeautifulSoup 解析 HTML
什么是爬虫?
爬虫是自动获取网页数据的程序,常用于数据采集、监控等场景。
requests 库
import requests
url = "https://api.github.com"
response = requests.get(url)
print(response.status_code)
print(response.json())
BeautifulSoup 解析
from bs4 import BeautifulSoup
html = "<h1>Hello</h1><p>World</p>"
soup = BeautifulSoup(html, "html.parser")
print(soup.h1.text) # Hello
注意事项
- 遵守网站的 robots.txt
- 控制请求频率
- 不要爬取敏感数据
动手练习
- 爬取天气数据显示在控制台
- 获取豆瓣电影 Top 250
- 制作每日新闻聚合器