# 项目实战:爬虫入门 ## 学习目标 - 了解爬虫的基本原理 - 掌握 requests 库的使用 - 学会使用 BeautifulSoup 解析 HTML ## 什么是爬虫? 爬虫是自动获取网页数据的程序,常用于数据采集、监控等场景。 ## requests 库 ```python import requests url = "https://api.github.com" response = requests.get(url) print(response.status_code) print(response.json()) ``` ## BeautifulSoup 解析 ```python from bs4 import BeautifulSoup html = "
World
" soup = BeautifulSoup(html, "html.parser") print(soup.h1.text) # Hello ``` ## 注意事项 1. 遵守网站的 robots.txt 2. 控制请求频率 3. 不要爬取敏感数据 ## 动手练习 1. 爬取天气数据显示在控制台 2. 获取豆瓣电影 Top 250 3. 制作每日新闻聚合器