全网整合营销服务商

电脑端+手机端+微信端=数据同步管理

免费咨询热线:400-708-3566

Python动态网页爬取方法_selenium与requests结合【指导】

动态网页爬取需结合Selenium与requests:Selenium模拟浏览器执行JS并获取渲染后HTML或提取API参数,requests高效调用接口;登录等交互用Selenium,后续数据请求交由requests,并注意Cookie、Headers一致性及反爬规避。

动态网页爬取不能只靠 requests,因为很多内容由 JavaScript 渲染,服务器返回的 HTML 源码里压根没有目标数据。这时候得让浏览器“真打开页面、执行 JS、等加载完”,再把渲染后的 HTML 或接口数据拿回来——Selenium 负责模拟真实浏览行为,requests 负责高效获取接口或静态资源,二者配合才是实用解法。

先用 Selenium 获取渲染后的真实 HTML

适用于页面结构依赖 JS 初始化(比如点击加载、滚动触底、Vue/React 渲染的列表),且你只需要最终 DOM 内容。

  • 启动 ChromeDriver(推荐无头模式: options.add_argument('--headless=new')
  • driver.get(url) 打开页面,再用 WebDriverWait 等待关键元素出现(别用 time.sleep
  • 调用 driver.page_source 获取完整渲染后的 HTML,之后可交给 BeautifulSoup 解析
  • 示例:等 class="item-list" 的 div 加载完成再取源码

用 Selenium 提取请求参数,再用 requests 发起真实 API 调用

很多动态页背后是 Ajax 接口(如 XHR/Fetch),Selenium 可以帮你“看懂”这些请求怎么发的,而 requests 更快更轻量,适合批量抓取。

  • 在 Selenium 中打开开发者工具(Network → XHR),手动操作触发目标数据加载,记下请求 URL、Headers(尤其是 Cookie、User-Agent、X-Requested-With)、Query 参数和 POST Body
  • driver.get_cookie('name')driver.execute_script("return document.cookie") 提取登录态 Cookie
  • requests.Session() 复用会话,设置相同 headers 和 cookies,直接调用接口获取 JSON 数据
  • 优势:绕过浏览器渲染,速度快;适合翻页、分页拉取大量数据

混合策略:Selenium 做登录/跳转,requests 接管后续所有接口

登录态往往需要交互(验证码、滑块、OAuth 跳转),Selenium 更可靠;但登录成功后,几乎所有业务数据都走接口,这时切回 requests 更稳。

  • 用 Selenium 完成账号密码输入、点击登录、等待跳转到首页或用户中心
  • 提取当前 driver 的 cookies 和 headers(注意保留 Authorization token 或 sessionid
  • 把 cookies 转为 requests 可用格式:requests.utils.dict_from_cookiejar(driver.get_cookies())
  • 后续所有数据请求全部交给 requests,不用再开浏览器,内存和时间成本大幅下降

注意事项与避坑点

结合使用不是简单拼凑,几个关键细节决定成败:

  • Cookie 时效性:Selenium 获取的 cookie 可能含 HttpOnly,requests 无法自动携带,需显式传入;部分站点还校验 User-AgentReferer,headers 必须一致
  • 反爬识别:Selenium 默认特征明显(如 webdriver 属性),需加配置隐藏:options.add_experimental_option("excludeSwitches", ["enable-automation"]) 并禁用 useAutomationExtension
  • 请求频率控制:requests 接口调用比浏览器快得多,务必加 time.sleep 或使用 ratelimit 库,避免被封 IP
  • 异常兜底:Selenium 可能超时或崩溃,requests 可能返回 401/403,建议用 try-except 包裹关键步骤,并设计重试逻辑
不复杂但容易忽略:真正高效的动态爬取,不是“全用 Selenium”,也不是“硬刚 requests”,而是让每个工具做它最擅长的事。


# vue  # react  # javascript  # python  # java  # html  # js  # json  # ajax  # cookie 


相关文章: 如何在IIS中新建站点并配置端口与物理路径?  建站主机服务器选型指南与性能优化方案解析  孙琪峥织梦建站教程如何优化数据库安全?  如何用低价快速搭建高质量网站?  名字制作网站免费,所有小说网站的名字?  如何在万网主机上快速搭建网站?  如何用美橙互联一键搭建多站合一网站?  山东云建站价格为何差异显著?  如何在Golang中使用replace替换模块_指定本地或远程路径  建站主机选哪家性价比最高?  南宁网站建设制作定制,南宁网站建设可以定制吗?  香港代理服务器配置指南:高匿IP选择、跨境加速与SEO优化技巧  深圳网站制作的公司有哪些,dido官方网站?  怎么将XML数据可视化 D3.js加载XML  如何选择适配移动端的WAP自助建站平台?  宝塔新建站点为何无法访问?如何排查?  ppt制作免费网站有哪些,ppt模板免费下载网站?  已有域名建站全流程解析:网站搭建步骤与建站工具选择  如何在阿里云域名上完成建站全流程?  logo在线制作免费网站在线制作好吗,DW网页制作时,如何在网页标题前加上logo?  *服务器网站为何频现安全漏洞?  网站微信制作软件,如何制作微信链接?  建站主机是否等同于虚拟主机?  制作网站建设的公司有哪些,网站建设比较好的公司都有哪些?  定制建站哪家更专业可靠?推荐榜单揭晓  怎么制作网站设计模板图片,有电商商品详情页面的免费模板素材网站推荐吗?  网站制作话术技巧,网站推广做的好怎么话术?  建站主机服务器选购指南:轻量应用与VPS配置解析  音乐网站服务器如何优化API响应速度?  建站主机选虚拟主机还是云服务器更好?  建站之星安全性能如何?防护体系能否抵御黑客入侵?  长沙企业网站制作哪家好,长沙水业集团官方网站?  建站主机系统SEO优化与智能配置核心关键词操作指南  网站企业制作流程,用什么语言做企业网站比较好?  如何基于PHP生成高效IDC网络公司建站源码?  行程制作网站有哪些,第三方机票电子行程单怎么开?  网站设计制作企业有哪些,抖音官网主页怎么设置?  如何注册花生壳免费域名并搭建个人网站?  C++如何编写函数模板?(泛型编程入门)  一键制作网站软件下载安装,一键自动采集网页文档制作步骤?  网站制作公司广州有几家,广州尚艺美发学校网站是多少?  如何通过免费商城建站系统源码自定义网站主题与功能?  个人摄影网站制作流程,摄影爱好者都去什么网站?  建站之星如何实现网站加密操作?  如何在建站之星网店版论坛获取技术支持?  寿县云建站:智能SEO优化与多行业模板快速上线指南  Python如何创建带属性的XML节点  如何制作算命网站,怎么注册算命网站?  建站之星手机一键生成:多端自适应+小程序开发快速建站指南  php能控制zigbee模块吗_php通过串口与cc2530 zigbee通信【介绍】 

您的项目需求

*请认真填写需求信息,我们会在24小时内与您取得联系。