sync from local backup
This commit is contained in:
@@ -0,0 +1,43 @@
|
||||
# 项目实战:爬虫入门
|
||||
|
||||
## 学习目标
|
||||
- 了解爬虫的基本原理
|
||||
- 掌握 requests 库的使用
|
||||
- 学会使用 BeautifulSoup 解析 HTML
|
||||
|
||||
## 什么是爬虫?
|
||||
|
||||
爬虫是自动获取网页数据的程序,常用于数据采集、监控等场景。
|
||||
|
||||
## requests 库
|
||||
|
||||
```python
|
||||
import requests
|
||||
|
||||
url = "https://api.github.com"
|
||||
response = requests.get(url)
|
||||
print(response.status_code)
|
||||
print(response.json())
|
||||
```
|
||||
|
||||
## BeautifulSoup 解析
|
||||
|
||||
```python
|
||||
from bs4 import BeautifulSoup
|
||||
|
||||
html = "<h1>Hello</h1><p>World</p>"
|
||||
soup = BeautifulSoup(html, "html.parser")
|
||||
print(soup.h1.text) # Hello
|
||||
```
|
||||
|
||||
## 注意事项
|
||||
|
||||
1. 遵守网站的 robots.txt
|
||||
2. 控制请求频率
|
||||
3. 不要爬取敏感数据
|
||||
|
||||
## 动手练习
|
||||
|
||||
1. 爬取天气数据显示在控制台
|
||||
2. 获取豆瓣电影 Top 250
|
||||
3. 制作每日新闻聚合器
|
||||
Reference in New Issue
Block a user