Python使用scrapy采集数据过程中放回下载过大页面的方法

PHP中文网 • 2025年2月28日 02:33:34 • 编程技术 • 阅读 2

本文实例讲述了python使用scrapy采集数据过程中放回下载过大页面的方法。分享给大家供大家参考。具体分析如下：

添加以下代码到settings.py，myproject为你的项目名称

复制代码代码如下:DOWNLOADER_HTTPCLIENTFACTORY = ‘myproject.downloader.LimitSizeHTTPClientFactory’

自定义限制下载过大页面的模块

复制代码代码如下:MAX_RESPONSE_SIZE = 1048576 # 1Mb
from scrapy.core.downloader.webclient import ScrapyHTTPClientFactory, ScrapyHTTPPageGetter
class LimitSizePageGetter(ScrapyHTTPPageGetter):
    def handleHeader(self, key, value):
        ScrapyHTTPPageGetter.handleHeader(self, key, value)
        if key.lower() == ‘content-length’ and int(value) > MAX_RESPONSE_SIZE:
            self.connectionLost(‘oversized’)
class LimitSizeHTTPClientFactory(ScrapyHTTPClientFactory):
     protocol = LimitSizePageGetter

希望本文所述对大家的Python程序设计有所帮助。

发布者：PHP中文网，转转请注明出处：https://www.chuangxiangniao.com/p/2294025.html

- 下载 Python Scrapy 大页面采集数据

0 0

关于作者

PHP中文网签约作者

285.5K 文章

0 评论

1 粉丝

php中文网提供大量免费、原创、高清的php视频教程，并定期举行公益php培训！可边学习边在线修改示例代码，查看执行效果！php从入门到精通，一站式php自学平台！

Python中用format函数格式化字符串的用法

上一篇 2025年2月28日 02:33:24

php包含哪些字段

下一篇 2025年2月18日 04:10:36

Python中用format函数格式化字符串的用法

自python2.6开始，新增了一种格式化字符串的函数str.format()，可谓威力十足。那么，他跟之前的%型格式化字符串相比，有什么优越的存在呢？让我们来揭开它羞答答的面纱。语法它通过{}和:来代替%。“映射”示例通过位置 In …

PHP中文网
编程技术 2025年2月28日
2000
Python实现的简单文件传输服务器和客户端

还是那个题目（题目和流程见java版本），感觉光用java写一点新意也没有，恰巧刚学习了python，何不拿来一用，呵呵：服务器端： import SocketServer, time class MyServer(SocketServer…

PHP中文网
编程技术 2025年2月28日
2000
Python实现把xml或xsl转换为html格式

前些天用python处理xml的转换的一个小程序，用来把xml,xsl转换成html。用的libxml2，所以还要先安装了libxml2模块才能使用。 # -*- coding: mbcs -*- #!/usr/bin/pythonimp…

PHP中文网
编程技术 2025年2月28日
2000
Python打印scrapy蜘蛛抓取树结构的方法

本文实例讲述了python打印scrapy蜘蛛抓取树结构的方法。分享给大家供大家参考。具体如下：通过下面这段代码可以一目了然的知道scrapy的抓取页面结构，调用也非常简单 #!/usr/bin/env pythonimport file…

PHP中文网
编程技术 2025年2月28日
2000
Python实现在线程里运行scrapy的方法

本文实例讲述了python实现在线程里运行scrapy的方法。分享给大家供大家参考。具体如下：如果你希望在一个写好的程序里调用scrapy，就可以通过下面的代码，让scrapy运行在一个线程里。 “””Code to run Scrapy…

PHP中文网
编程技术 2025年2月28日
2000
Python实现从脚本里运行scrapy的方法

本文实例讲述了python实现从脚本里运行scrapy的方法。分享给大家供大家参考。具体如下：复制代码代码如下:#!/usr/bin/pythonimport osos.environ.setdefault(‘SCRAPY_…

PHP中文网
编程技术 2025年2月28日
2000
用Python实现一个简单的能够发送带附件的邮件程序的教程

基本思路就是，使用MIMEMultipart来标示这个邮件是多个部分组成的，然后attach各个部分。如果是附件，则add_header加入附件的声明。在python中，MIME的这些对象的继承关系如下。MIMEBase |&#821…

PHP中文网
编程技术 2025年2月28日
2000
Python中用memcached来减少数据库查询次数的教程

本来我一直不知道怎么来更好地优化网页的性能，然后最近做python和php同类网页渲染速度比较时，意外地发现一个很简单很白痴但是我一直没发现的好方法（不得不bs我自己）：直接像某些php应用比如discuz论坛那样，在生成的网页中打印出“…

PHP中文网
编程技术 2025年2月28日
2000
Python中使用pprint函数进行格式化输出的教程

pprint – 美观打印作用：美观打印数据结构 pprint 包含一个“美观打印机”，用于生成数据结构的一个美观视图。格式化工具会生成数据结构的一些表示，不仅可以由解释器正确地解析，而且便于人类阅读。输出尽可能放在一行上，分解为多行时则…

PHP中文网
编程技术 2025年2月28日
2000
利用QT写一个极简单的图形化Python闹钟程序

今天我们讲一下用python写的gui小程序。一个小闹钟（只是屏幕提示，没有声音哦）让我们先介绍这个闹钟如何奇葩。需要通过命令行启动。没有标题栏。没菜单。立即学习“Python免费学习笔记（深入）”；甚至没有关闭按钮。没有运行…

PHP中文网
编程技术 2025年2月28日
2000

发表回复

登录后才能评论

Python使用scrapy采集数据过程中放回下载过大页面的方法

关于作者

AD推荐 黄金广告位招租... 更多推荐

相关推荐

发表回复

分享到:

请登录

AD推荐黄金广告位招租... 更多推荐