实现项目中传入多个中间件

小编 2026-06-18 阅读:445 评论:0
目标 完成代码的重构,实现多个中间件的效果 1 为什么需要多个中间件 不同的中间件可以实现对请求或者是响应对象进行不同的处理,通过不同的中间件实现不同的功能,让逻辑更加清晰 2 在项目文件夹中创建mi...

目标

  • 完成代码的重构,实现多个中间件的效果

1 为什么需要多个中间件

不同的中间件可以实现对请求或者是响应对象进行不同的处理,通过不同的中间件实现不同的功能,让逻辑更加清晰

2 在项目文件夹中创建middlewares文件

  • 项目文件夹中的spider_middlewares.py:
class TestSpiderMiddleware1(object):

    def process_request(self, request):
        \'\'\'处理请求头,添加默认的user-agent\'\'\'
        print(\"TestSpiderMiddleware1: process_request\")
        return request

    def process_item(self, item):
        \'\'\'处理数据对象\'\'\'
        print(\"TestSpiderMiddleware1: process_item\")
        return item


class TestSpiderMiddleware2(object):

    def process_request(self, request):
        \'\'\'处理请求头,添加默认的user-agent\'\'\'
        print(\"TestSpiderMiddleware2: process_request\")
        return request

    def process_item(self, item):
        \'\'\'处理数据对象\'\'\'
        print(\"TestSpiderMiddleware2: process_item\")
        return item
  • 项目文件夹中的downloader_middlewares.py:
class TestDownloaderMiddleware1(object):

    def process_request(self, request):
        \'\'\'处理请求头,添加默认的user-agent\'\'\'
        print(\"TestDownloaderMiddleware1: process_request\")
        return request

    def process_response(self, item):
        \'\'\'处理数据对象\'\'\'
        print(\"TestDownloaderMiddleware1: process_response\")
        return item


class TestDownloaderMiddleware2(object):

    def process_request(self, request):
        \'\'\'处理请求头,添加默认的user-agent\'\'\'
        print(\"TestDownloaderMiddleware2: process_request\")
        return request

    def process_response(self, item):
        \'\'\'处理数据对象\'\'\'
        print(\"TestDownloaderMiddleware2: process_response\")
        return item

2 修改项目文件夹中的main.py

为引擎传入多个中间件

from scrapy_plus.core.engine import Engine    # 导入引擎

from spiders.baidu import BaiduSpider
from spiders.douban import DoubanSpider
from pipeline import BaiduPipeline, DoubanPipeline
from spider_middlewares import TestSpiderMiddleware1, TestSpiderMiddleware2
from downloader_middlewares import TestDownloaderMiddleware1, TestDownloaderMiddleware2

if __name__ == \'__main__\':
    baidu_spider = BaiduSpider()    # 实例化爬虫对象
    douban_spider = DoubanSpider()    # 实例化爬虫对象

    spiders = {BaiduSpider.name: baidu_spider, DoubanSpider.name: douban_spider}    # 爬虫们
    pipelines = [BaiduPipeline(), DoubanPipeline()]    # 管道们
    spider_mids = [TestSpiderMiddleware1(), TestSpiderMiddleware2()]    # 多个爬虫中间件
    downloader_mids = [TestDownloaderMiddleware1(), TestDownloaderMiddleware2()]    # 多个下载中间件

    engine = Engine(spiders, pipelines=pipelines, spider_mids=spider_mids, downloader_mids=downloader_mids)    # 传入爬虫对象
    engine.start()    # 启动引擎

3 因此相应的的修改engine.py

改为使用多个中间件

# scrapy_plus/core/engine.py
.....

class Engine:
    \'\'\'完成对引擎模块的封装\'\'\'

    def __init__(self,spiders,pipelines=[],spider_mids=[],downloader_mids=[]):
        \'\'\'
        实例化其他的组件,在引起中能够通过调用组件的方法实现功能
        \'\'\'
        # self.spider = Spider()
        self.spiders = spiders
        self.downloader = Downloader()
        self.pipelines = pipelines
        self.scheduler = Scheduler()
        self.spider_mids = spider_mids
        self.downloader_mids = downloader_mids
        self.total_request_nums = 0
        self.total_response_nums = 0


    def start(self):
        \'\'\'
        提供引擎启动的入口
        :return:
        \'\'\'
        start_time = datetime.now()
        logger.info(\"爬虫启动:{}\".format(start_time))
        self._start_engine()
        end_time = datetime.now()
        logger.info(\"爬虫结束:{}\".format(start_time))
        logger.info(\"爬虫一共运行:{}秒\".format((end_time-start_time).total_seconds()))
        logger.info(\"总的请求数量:{}\".format(self.total_request_nums))
        logger.info(\"总的响应数量:{}\".format(self.total_response_nums))


    def _start_request(self):
        for spider_name,spider in self.spiders.items():
            for start_request in spider.start_requests():
                #1. 对start_request进过爬虫中间件进行处理
                for spider_mid in self.spider_mids:
                    start_request = spider_mid.process_request(start_request)
                start_request.spider_name = spider_name

                #2. 调用调度器的add_request方法,添加request对象到调度器中
                self.scheduler.add_request(start_request)
                #请求数+1
                self.total_request_nums += 1

    def _execute_request_response_item(self):
        #3. 调用调度器的get_request方法,获取request对象
        request = self.scheduler.get_request()
        if request is None: #如果没有获取到请求对象,直接返回
            return

        #request对象经过下载器中间件的process_request进行处理
        for downloader_mid in self.downloader_mids:
            request = downloader_mid.process_request(request)

        #4. 调用下载器的get_response方法,获取响应
        response = self.downloader.get_response(request)

        response.meta = request.meta

        #response对象经过下载器中间件的process_response进行处理
        for downloader_mid in self.downloader_mids:
            response = downloader_mid.process_response(response)
        #response对象经过下爬虫中间件的process_response进行处理
        for spider_mid in self.spider_mids:
            response = spider_mid.process_response(response)

        #parse方法
        spider = self.spiders[request.spider_name]
        parse = getattr(spider,request.parse)

        #5. 调用爬虫的parse方法,处理响应
        for result in parse(response):
            #6.判断结果的类型,如果是request,重新调用调度器的add_request方法
            if isinstance(result,Request):
                #在解析函数得到request对象之后,使用process_request进行处理
                for spider_mid in self.spider_mids:
                    result = spider_mid.process_request(result)
                result.spider_name = request.spider_name
                self.scheduler.add_request(result)
                self.total_request_nums += 1
            #7如果不是,调用pipeline的process_item方法处理结果
            else:
                for pipeline in self.pipelines:
                    result = pipeline.process_item(result,spider)

        self.total_response_nums += 1

    def _start_engine(self):
        \'\'\'
        具体的实现引擎的细节
        :return:
        \'\'\'
        self._start_request()
        while True:
            time.sleep(0.001)
            self._execute_request_response_item()
            if self.total_response_nums>= self.total_request_nums:
                break
    ......
版权声明

本文仅代表作者观点,不代表百度立场。
本文系作者授权百度百家发表,未经许可,不得转载。

热门文章
  • 机房智能化温湿度解决方式之POE供电以太网温湿度传感器

    机房智能化温湿度解决方式之POE供电以太网温湿度传感器
    机房智能化温湿度解决方式之POE供电以太网温湿度传感器 北京盈创力和电子科技有限公司 智能型TCP网口温湿度记录仪 北京IP网络温湿度记录仪厂家,北京盈创力和 北京智能型TCP网口温湿度记录仪IP网络温湿度记录仪是一种新型的基于TCP/IP协议双绞线以太网标准温湿度采集模块,利用它可以实现现场温度值、相对湿度值的采集,同时利用其自身的RJ45通信接口可以方便地和机房监控主机或交换机集线器进行联网。 工作于-40℃~85℃工业级带...
  • Sequential Monte Carlo Methods (SMC) 序列蒙特卡洛/粒子滤波/Bootstrap Filtering

    Sequential Monte Carlo Methods (SMC) 序列蒙特卡洛/粒子滤波/Bootstrap Filtering
    Problem Statement 我们考虑一个具有马尔可夫性质、非线性、非高斯的状态空间模型(State Space Model):对于一个时间序列上的观测结果{yt,t∈N}\\{ y_t , t \\in N \\}{yt​,t∈N},我们认为每个观测结果yty_tyt​的生成依赖于一个无法直接观察的隐变量xt∈{xt,t∈N}x_t \\in \\{x_t , t \\in N \\}xt​∈{xt​,t∈N},即:p(...
  • HTTP状态保持的原理

    HTTP状态保持的原理
    a)在用户登录之后,浏览器返回响应的时候会在响应中添加上cookieb)浏览器接收到cookie之后会自动保存c)当用户再次请求同一服务器中的其他网页的时候,浏览器会自动带上之前保存的cookied)服务接收到请求之后可以请 request 对象中取到cookie 判断当前用户是否登录  Http是无状态的,就是连接时数据互通,关闭后...
  • Hive 系统函数及示例

    Hive 系统函数及示例
    查看所有系统函数 show functions; 函数分类 内置函数【系统函数】 数学函数: floor、round、ceil、cos、log2等 字符串函数: length、reverse、trim、lower、get_json_object、repeat等 收集函数: size 转换函数: cast 日期函数: year、month、datediff、date、date_add等 条件函数: coalesce、case…w...
  • CSRF的原理和防范措施

    CSRF的原理和防范措施
    a)攻击原理:i.用户C访问正常网站A时进行登录,浏览器保存A的cookieii.用户C再访问攻击网站B,网站B上有某个隐藏的链接或者图片标签会自动请求网站A的URL地址,例如表单提交,传指定的参数iii.而攻击网站B在访问网站A的时候,浏览器会自动带上网站A的cookieiv.所以网站A在接收到请求之后可判断当前用户是登录状态,所以...
标签列表