44 lines
816 B
Markdown
44 lines
816 B
Markdown
# 项目实战:爬虫入门
|
|
|
|
## 学习目标
|
|
- 了解爬虫的基本原理
|
|
- 掌握 requests 库的使用
|
|
- 学会使用 BeautifulSoup 解析 HTML
|
|
|
|
## 什么是爬虫?
|
|
|
|
爬虫是自动获取网页数据的程序,常用于数据采集、监控等场景。
|
|
|
|
## requests 库
|
|
|
|
```python
|
|
import requests
|
|
|
|
url = "https://api.github.com"
|
|
response = requests.get(url)
|
|
print(response.status_code)
|
|
print(response.json())
|
|
```
|
|
|
|
## BeautifulSoup 解析
|
|
|
|
```python
|
|
from bs4 import BeautifulSoup
|
|
|
|
html = "<h1>Hello</h1><p>World</p>"
|
|
soup = BeautifulSoup(html, "html.parser")
|
|
print(soup.h1.text) # Hello
|
|
```
|
|
|
|
## 注意事项
|
|
|
|
1. 遵守网站的 robots.txt
|
|
2. 控制请求频率
|
|
3. 不要爬取敏感数据
|
|
|
|
## 动手练习
|
|
|
|
1. 爬取天气数据显示在控制台
|
|
2. 获取豆瓣电影 Top 250
|
|
3. 制作每日新闻聚合器
|