当前位置: 首页 > news >正文

scrapy爬取动态页面的正确姿势

不能否认, 它是相当出色的爬虫框架, 其借用的是相似的办法去爬取网页, 即所爬取的是静态页面, 然而实际情形是, 多数网站均为动态的, 我们所见到的正常页面皆是经浏览器渲染后的成果, 倘若径直运用爬取网页的方式, 极有可能无法获取到预期的数据。一种看似理所当然的办法, 便是借助自定义, 采用类似于这种模拟浏览器行为的途径, 从而直接获取到渲染好的html内容, 这般做无疑是行得通的, 而且也能够较为轻易地实现对接, 其存在的欠缺之处在于, 会造成资源消耗的增加。

另外存在一种能够直接抵达本质的途径, 那便是寻找到数据的起始源头, 其中有的借助ajax请求去获取数据源, 有的把数据源放置于js代码里, 借助浏览器开发工具对交互过程予以分析, 当找到数据源头后, 要是属于ajax请求, 只要直接请求对应的接口便可以获取到数据, 本文会对数据源在js文件中的提取方式进行介绍。

举个例子

在此处, 是以某文库的搜索结果当作例子的, 要是直接去进行页面爬取, 那是无法看到下图里的搜索结果的, 经过对页面结构加以分析, 发现源头数据处于脚本之中, 脚本里面大致上就是类似于json的数据对象, 只要获取到js脚本的对象数据, 那就等同于得到了搜索结果。

安装

能够对js脚本予以解析, 进而获取其中的数据对象, 在此推荐这个库, 它可以直接把js里的数据对象返回, 极为便利, 在使用前需借助pip安装此库。要留意的是, 其核心代码是用c编写而成, 所以在安装时要事先安装c++构建工具。

1. 如果事先没有安装c++构建工具会报错

2. 访问上面错误提示中的链接下载c++构建工具并安装

安装成功之后再次执行pip 安装成功

shell

Shell能够运用交互形式迅速验证用于提取数据的代码, 并非要一次次去运行爬虫进行验证, 极为高效, 接下来就要演示怎样借助shell将js中的数据提取出来。

启动 shell

scrapy shell "https://wenku.baidu.com/search?word=python&lm=0&od=0&fr=top_home&ie=utf-8&_wkts_=1711155481643&wkQuery=python"

根据返回的结果而言, 已然获取到所爬取的页面内容, 紧接着主要会以其进行数据提取。

我们已然清楚数据源处于内里, 径直运用.css('')能够获取全部的, 我们所需求的是第二个当中的脚本。

从中直接取出js脚本, 通过.css("::text")来进行获取。

最后就是导入库,执行js代码并获取返回的数据对象

import chompjs data = chompjs.parse_js_object(js_code)

data属于dict字典对象, 所需的数据处于‘’这个键当中, 到这里, 便成功完成啦。

我来做个简单总结, 我觉得运用写爬虫根本没必要用到像这般的模拟浏览器下载器, 解决之道是寻找到数据的源头, 没有数据源的话动态网站也就没办法进行渲染了。然而, 此处遗漏了一个关键的环节, 那便是登录, 不同的平台登录机制存在差异, 形形色色的验证码令人烦扰, 直接对抗极有可能撞得头破血流, 所以我不提议将登录部分编写在爬虫之中, 一种更为优良的方案是单独去开发一个池服务, 池服务承担着管理所有平台用户登录的职责, 对于无法自动登录的情况就提供手工登录加以解决, 并且通过 web api 来提供随机获取的功能, 借助调用池的 api 来达成模拟已登录用户状态的目的。

http://www.cnnetsun.cn/news/4227025.html

相关文章:

  • 基于springboot2+vue2的租房管理系统
  • 基于SpringBoot的大学生竞赛管理系统
  • 交叉效率 DEA 激进型模型计算准确性验证 —— 基于 DEA Performance 的数值验算
  • Codex 多文件协同修改,小心处理依赖冲突与连锁反应
  • 《易学・贲䷕|道影子新解 022》
  • 食品加工技术课程概述
  • 四子棋智能体构建与在线对抗决策应用
  • 飞船乘客状态预测与金融风控建模启发
  • AI Agent 面试题 340:工具调用的成本计量和预算控制机制
  • 董宇辉的尽头是山姆?——个人IP如何转化为零售品牌
  • MyBatis 的注解式开发
  • 【TDengine】 TDengine 的内存管理模型是怎样的?缓存机制如何工作?
  • 【TDengine】TDengine 使用了哪些压缩算法?压缩率通常能达到多少?
  • 交叉编译零门槛:graphics.gd无需SDK构建Android、iOS与Web版Godot游戏
  • Video2X 完整上手:三步把模糊老视频放大到 4K、30fps 变 60fps
  • ArcGIS零起点实战教程|空间规划师必学GIS技能课(视频+数据包+工具集)
  • BlobRunner x64实现深度剖析:内联汇编为何失效,挂起线程如何救场
  • 记录C++ 11
  • 57-基于深度学习的农作物虫害检测识别系统(yolo26、yolo12、yolo11、yolov8、yolov5+UI界面+Python项目源码+模型+标注好的数据集)2027毕业版
  • OpenCV ncnn 人脸识别(一)
  • 如何部署AI模型到边缘端:keras_cv_attention_models TFLite转换完整指南(含3大常见坑)
  • 如何在org-trello中选择正确的同步方向?卡片级与缓冲区级同步完整指南
  • SAP UI5 里有没有 RxJS exhaustMap,答案不在某个 Operator,而在异步任务的并发控制方式
  • 从 clone 到登录:三十分钟用 Docker 部署 AzerothCore 魔兽世界私有服
  • C# Winform - SQL Server 2012 数据库放服务器,通过TCP连接访问
  • 如何用Dagger 2在Kotlin Android应用中实现依赖注入:基于PhotoAffix的完整教程
  • fb_graph认证全解析:Cookie解析与Signed Request的HMAC-SHA256验证原理指南
  • 为什么 Ornith-1.5-397B 效果忽好忽坏?temperature、top_p、top_k 采样参数调优完整指南
  • 5分钟上手psr/clock:从composer安装到第一个now()调用的快速教程
  • IntelliJ IDEA + phpStudy + ApiPost断点调试