前言：

在爬虫的开发过程中，有些业务场景需要同时抓取几百个甚至上千个站，此时就需要一个支持多爬虫的框架。在设计时应该要注意以下几点：

代码复用，功能模块化。如果针对每个站都写一个完整的爬虫，那其中必定包含了许多重复的工作，不仅开发效率不高，而且到后期整个爬虫项目会变得臃肿、难以管理。
易扩展。多爬虫框架，这最直观的需求就是方便扩展，新增一个待爬的目标站，我只需要写少量必要的内容（如抓取规则、解析规则、入库规则），这样最快最好。
健壮性、可维护性。这么多站同时抓取，错的概率更大，例如断、中途被防爬、爬到“脏数据”等等。所以必须要做好日志监控，能实时监控爬虫系统的状态，能准确、详细地定位错信息；另外要做好各种异常处理，如果你放假回来发现爬虫因为一个小问题已经挂掉了，那你会因为浪费了几天时间而可惜的（虽然事实上我个人会不时地远程查看爬虫状态）。
分布式。多站抓取，数据量一般也比较大，可分布式扩展，这也是必需的功能了。分布式，需要注意做好消息队列，做好多结点统一去重。
爬虫优化。这就是大话题了，但最基本的，框架应该要基于异步，或者使用协程+多进程。
架构简明，要方便以后未知功能模块的添加。

需求如上，说的已经很清楚了。下面介绍一种架构设计，是去年做的了，现在分享一下。具体的代码实现就暂不公开了。

正文：

以下将通过解释两张图来说明架构的设计思想。

这张图是上张图的另一种表述。
Htmls队列和Seed是队列可以独立分开，甚至数量也可以多开，之间没有联系。完全可以灵活地根据爬虫状态和硬件环境作调整。另外8G的内容可以让Redis作为Seeds队列存放5~8千万个种子。
分布式爬虫非常关键的一点：去重。可以看到多个解析器Analyzer共用一个去重队列，才能够保证数据的统一不重复。去重队列可以放在一台机上。基于Redis实现了Bloomfilter算法（详细见《基于Redis的Bloomfilter去重（附Python代码）》），理论上8G的内存可以满足30亿条URL的去重，如果允许漏失概率再大点的话能去重更多。

要写一个支持分布式、多爬虫的框架，具体的实现上还是有一定难度的。在实现主要功能以外，还要注意做到代码严谨规范，爬虫高效健壮的要求。做完这些以后，你定会成长不少！

今天就分享这些，欢迎交流！

文章知识点与官方知识档案匹配，可进一步学习相关知识云原生入门技能树首页概览8583 人正在系统学习中

声明：本站部分文章及图片源自用户投稿，如本站任何资料有侵权请您尽早请联系jinwei@zod.com.cn进行处理,非常感谢！