Files
chunyu_project/media/learn/courses/12/chapters/75.md
T
2026-08-05 23:59:15 +08:00

44 lines
816 B
Markdown

# 项目实战:爬虫入门
## 学习目标
- 了解爬虫的基本原理
- 掌握 requests 库的使用
- 学会使用 BeautifulSoup 解析 HTML
## 什么是爬虫?
爬虫是自动获取网页数据的程序,常用于数据采集、监控等场景。
## requests 库
```python
import requests
url = "https://api.github.com"
response = requests.get(url)
print(response.status_code)
print(response.json())
```
## BeautifulSoup 解析
```python
from bs4 import BeautifulSoup
html = "<h1>Hello</h1><p>World</p>"
soup = BeautifulSoup(html, "html.parser")
print(soup.h1.text) # Hello
```
## 注意事项
1. 遵守网站的 robots.txt
2. 控制请求频率
3. 不要爬取敏感数据
## 动手练习
1. 爬取天气数据显示在控制台
2. 获取豆瓣电影 Top 250
3. 制作每日新闻聚合器