技术频道

公众号推荐

微信公众号搜"智元新知"关注
微信扫一扫可直接关注哦！

网页爬虫

时间：2022-10-08分类：HTML作者：编程之家原文地址

记录一下如何抓一个网页：

做开发的经常会被问到怎么去抓别人的数据

那么抓数据可以分成抓接口数据或网页数据

其实都是网络上的内容，有各自的特点

抓接口数据一般通过第三方软件代理http来看到请求实体

而抓网页内容通常我们会叫它爬虫…

那么爬虫是怎么回事呢？

抓取网页有效内容并自动归并处理。

怎么实现：

如何抓-

1、通过第三方框架如phantomjs，webcrawl等，selnium等这些工具各有自己不同的使命。用法也不相同，缺点要求伪造技术高，程序不易被目标站点识别为爬虫。优点：高效便捷，自动化处理

2、通过自己写浏览器插件的形式，由于插件可以与网页内容做交互，所以这里要有一些html 标签以及selector的基础，缺点：要写很多代码，还要弄懂怎么跟浏览器通信，优点不易被网站识别是爬虫，可控性强

3、无侵入式爬取，借用手机，电脑，模拟器自动化处理，实现模拟点按，并自动下载保存.

优点：不易被网站识别，自动化高，缺点：模拟点击的话需要会调用一些人工智能的库，用模拟器的webview的话要会一些移动端的编程经验。

如何取-

取内容的过程比较简单：用一个html组件读取html文本，然后分析如html-parsor

版权声明：本文内容由互联网用户自发贡献，该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容，请发送邮件至 dio@foxmail.com 举报，一经查实，本站将立刻删除。

上一篇：webpack中的插件下一篇：通过JS为HTML标签添加样式

相关推荐

Vue+elementUI 自定义动态数据菜单导航组件实现展开收缩+路由跳转router-view渲染数据路由跳转到同一个页面带参数ID 自动刷新数据

准备:导入ElementUI 看官网教程数据准备:JSON数据转换成树状参考文章: JS实现 JSON扁平数据转换树状数据后台我拿的数据是这样的格式: [ {id:1 , parentId: 0, name: '', level: 0}, {id:2 , parentId: 0

作者：阿浩呗时间：2024-09-27

vue阻止冒泡事件阻止点击事件的执行结合div和组件阻止点击事件

vue阻止冒泡事件阻止点击事件的执行 <div @click="alerA1()" > <div @click.stop="alerA2()><div> </div> 这样就可以实现阻止点击点击 alerA2

作者：阿浩呗时间：2024-09-27

自用代码css获取任意网址的/favicon.ico的方法教程

尝试过使用网友说的API接口获取找到的都是失效了暂时就使用这种办法获取如果有好的方法望评论告知谢谢 <img :ng-src="'http://'+list.url+'/favicon.ico'" :src="'ht

作者：阿浩呗时间：2024-09-27

JS实现 JSON扁平数据转换树状数据

后台我拿的数据是这样的格式: [ {id:1 , parentId: 0, name: '', level: 0}, {id:2 , parentId: 0, name: '', level: 0}, {id:3 , parentId: 2, name: '&

作者：阿浩呗时间：2024-09-27

JAVA下载文件防重复点击,防止多次下载请求，Cookie方式快速简单集成教程

JAVA下载文件防重复点击,防止多次下载请求，Cookie方式快速简单集成教程 JS文件在最下面: 引入 <script src="${path}/js/jquery-2.0.3.min.js"></script> <script src=&quot

作者：阿浩呗时间：2024-09-27

Mip是什么意思以及作用有哪些

Mip是什么意思以及作用有哪些

作者：编程之家时间：2023-09-13

怎么测试Mip页面运行情况

怎么测试Mip页面运行情况

作者：编程之家时间：2023-09-13

MIP安装的具体步骤有哪些

MIP安装的具体步骤有哪些

作者：编程之家时间：2023-09-13

HTML添加超链接、锚点的方法及作用详解（附视频）

HTML添加超链接、锚点的方法及作用详解（附视频）

作者：编程之家时间：2023-09-13

MIP的规则有哪些

MIP的规则有哪些

作者：编程之家时间：2023-09-13

小编推荐

苹果市值2025年有望达4万亿美元