Files
chunyu_project/media/learn/courses/12/chapters/75.md
T
2026-08-05 23:59:15 +08:00

816 B

项目实战:爬虫入门

学习目标

  • 了解爬虫的基本原理
  • 掌握 requests 库的使用
  • 学会使用 BeautifulSoup 解析 HTML

什么是爬虫?

爬虫是自动获取网页数据的程序,常用于数据采集、监控等场景。

requests 库

import requests

url = "https://api.github.com"
response = requests.get(url)
print(response.status_code)
print(response.json())

BeautifulSoup 解析

from bs4 import BeautifulSoup

html = "<h1>Hello</h1><p>World</p>"
soup = BeautifulSoup(html, "html.parser")
print(soup.h1.text)  # Hello

注意事项

  1. 遵守网站的 robots.txt
  2. 控制请求频率
  3. 不要爬取敏感数据

动手练习

  1. 爬取天气数据显示在控制台
  2. 获取豆瓣电影 Top 250
  3. 制作每日新闻聚合器