1. 前言。
1.1. 需求背景。
每天抓取的是同一份商品的数据,用来做趋势分析。
要求每天都需要抓一份,也仅限抓取一份数据。
但是整个爬取数据的过程在时间上并不确定,受本地 络,代理速度,抓取数据量有关,一般情况下在20小时左右,极少情况下会超过24小时。
1.2. 实现功能。
通过以下三步,保证爬虫能自动隔天抓取数据:
每天凌晨00:01启动监控脚本,监控爬虫的运行状态,一旦爬虫进入空闲状态,启动爬虫。
一旦爬虫执行完毕,自动退出脚本,结束今天的任务。
一旦脚本距离启动时间超过24小时,自动退出脚本,等待第二天的监控脚本启动,重复这三步。
2. 环境。
python 3.6.1
系统:win7
IDE:pycharm
安装过scrapy
3. 设计思路。
3.1. 前提:
目前爬虫是通过scrapy模块自带的cmdline.execute来启动的。
from scrapy import cmdline
cmdline.execute(‘scrapy crawl mySpider’.split())
3.2. 将自动执行脚本做到scrapy爬虫的外部
(1)每天凌晨00:01启动脚本(控制脚本的存活时间为24小时),监测爬虫的运行状态(需要用一个标记信息来表示爬虫的状态:运行还是停止)。
如果爬虫处于运行状态(前一天爬取数据尚未结束),进入第(2)步;
如果爬虫处于非运行状态(前一天的爬取任务已完成,今天的尚未开始),进入第(3)步;
(2)脚本进入等待阶段,每隔10分钟,检查一下爬虫的运行状态,如(1)。但是一旦发现,脚本的等待时间超过了24小时,则自动退出脚本,因为第二天的监测脚本已经开始运行了,接替了它的任务。
(3)做一些爬虫启动前的准备工作(删除用来续爬的文件,防止爬虫不运行了),启动爬虫爬取数据,待爬虫正常结束后,退出脚本,完成当天的爬取任务。
4. 准备工作。
4.1. 标记爬虫的运行状态。
通过判断文件是否存在的方式来判断爬虫是否处于运行状态:
在爬虫启动时,创建一个isRunning.txt文件。
在爬虫结束时,删除这个isRunning.txt文件。
那么isRunning.txt存在,就说明爬虫正在运行;文件不存在,就说明爬虫不在运行。
# 文件pipelines.py
# 爬虫启动时
checkFile = “isRunning.txt”
class myPipeline:
def open_spider(self, spider):
self.client = MongoClient(‘localhost:27017’) # 连接Mongodb
self.db = self.client[‘mydata’] # 待存储数据的数据库mydata
f = open(checkFile, “w”) # 创建一个文件,代表爬虫在运行中
f.close()
# 文件pipelines.py
# 爬虫正常结束时
checkFile = “isRunning.txt”
class myPipeline:
def close_spider(self, spider):
self.client.close()
isFileExsit = os.path.isfile(checkFile)
if isFileExsit:
os.remove(checkFile)
4.2. 爬虫支持续爬,能随时暂停,方便调试。
# 在scrapy项目中添加start.py文件,用于启动爬虫
from scrapy import cmdline
# 在爬虫运行过程中,会自动将状态信息存储在crawls/storeMyRequest目录下,支持续爬
cmdline.execute(‘scrapy crawl mySpider -s JOBDIR=crawls/storeMyRequest’.split())
# Note:若想支持续爬,在ctrl+c终止爬虫时,只能按一次,爬虫在终止时需要进行善后工作,切勿连续多次按ctrl+c
4.5. 编写批处理文件启动爬虫
# 文件run.bat
cd /d F:/newClawer20170831/mySpider
call python main.py
pause
(3)如果想支持续传,只能按一次 ctrl + c 来停止爬虫运行。因为终止爬虫时,爬虫需要做一些善后工作,如果连续按多次ctrl + c来停止爬虫,爬虫将来不及善后,会导致无法续爬。 6.3. 效果展示。
正常执行完成:
到此这篇关于python实现scrapy爬虫每天定时抓取数据的示例代码的文章就介绍到这了,更多相关python scrapy定时抓取内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家!
文章知识点与官方知识档案匹配,可进一步学习相关知识Python入门技能树 络爬虫Scrapy框架211389 人正在系统学习中 相关资源:开源的爬虫软件Heritrix3.1.0_开源爬虫-Java工具类资源-CSDN文库
声明:本站部分文章及图片源自用户投稿,如本站任何资料有侵权请您尽早请联系jinwei@zod.com.cn进行处理,非常感谢!