Python实现在线程里运行scrapy的方法

PHP中文网 • 2025年2月28日 02:32:40 • 编程技术 • 阅读 2

本文实例讲述了python实现在线程里运行scrapy的方法。分享给大家供大家参考。具体如下：

如果你希望在一个写好的程序里调用scrapy，就可以通过下面的代码，让scrapy运行在一个线程里。

"""Code to run Scrapy crawler in a thread - works on Scrapy 0.8"""import threading, Queuefrom twisted.internet import reactorfrom scrapy.xlib.pydispatch import dispatcherfrom scrapy.core.manager import scrapymanagerfrom scrapy.core.engine import scrapyenginefrom scrapy.core import signalsclass CrawlerThread(threading.Thread):  def __init__(self):    threading.Thread.__init__(self)    self.running = False  def run(self):    self.running = True    scrapymanager.configure(control_reactor=False)    scrapymanager.start()    reactor.run(installSignalHandlers=False)  def crawl(self, *args):    if not self.running:      raise RuntimeError("CrawlerThread not running")    self._call_and_block_until_signal(signals.spider_closed,       scrapymanager.crawl, *args)  def stop(self):    reactor.callFromThread(scrapyengine.stop)  def _call_and_block_until_signal(self, signal, f, *a, **kw):    q = Queue.Queue()    def unblock():      q.put(None)    dispatcher.connect(unblock, signal=signal)    reactor.callFromThread(f, *a, **kw)    q.get()# Usage example below: import osos.environ.setdefault('SCRAPY_SETTINGS_MODULE', 'myproject.settings')from scrapy.xlib.pydispatch import dispatcherfrom scrapy.core import signalsfrom scrapy.conf import settingsfrom scrapy.crawler import CrawlerThreadsettings.overrides['LOG_ENABLED'] = False # avoid log noisedef item_passed(item):  print "Just scraped item:", itemdispatcher.connect(item_passed, signal=signals.item_passed)crawler = CrawlerThread()print "Starting crawler thread..."crawler.start()print "Crawling somedomain.com...."crawler.crawl('somedomain.com) # blocking callprint "Crawling anotherdomain.com..."crawler.crawl('anotherdomain.com') # blocking callprint "Stopping crawler thread..."crawler.stop()

登录后复制

希望本文所述对大家的Python程序设计有所帮助。

发布者：PHP中文网，转转请注明出处：https://www.chuangxiangniao.com/p/2293971.html

0 0

关于作者

PHP中文网签约作者

285.5K 文章

0 评论

1 粉丝

php中文网提供大量免费、原创、高清的php视频教程，并定期举行公益php培训！可边学习边在线修改示例代码，查看执行效果！php从入门到精通，一站式php自学平台！

Python实现从脚本里运行scrapy的方法

上一篇 2025年2月28日 02:32:34

如何在PHP中实现用户注册时发送手机验证码和短信通知

下一篇 2025年2月19日 07:14:34

Python实现从脚本里运行scrapy的方法

本文实例讲述了python实现从脚本里运行scrapy的方法。分享给大家供大家参考。具体如下：复制代码代码如下:#!/usr/bin/pythonimport osos.environ.setdefault(‘SCRAPY_…

PHP中文网
编程技术 2025年2月28日
2000
用Python实现一个简单的能够发送带附件的邮件程序的教程

基本思路就是，使用MIMEMultipart来标示这个邮件是多个部分组成的，然后attach各个部分。如果是附件，则add_header加入附件的声明。在python中，MIME的这些对象的继承关系如下。MIMEBase |&#821…

PHP中文网
编程技术 2025年2月28日
2000
Python中用memcached来减少数据库查询次数的教程

本来我一直不知道怎么来更好地优化网页的性能，然后最近做python和php同类网页渲染速度比较时，意外地发现一个很简单很白痴但是我一直没发现的好方法（不得不bs我自己）：直接像某些php应用比如discuz论坛那样，在生成的网页中打印出“…

PHP中文网
编程技术 2025年2月28日
2000
Python中使用pprint函数进行格式化输出的教程

pprint – 美观打印作用：美观打印数据结构 pprint 包含一个“美观打印机”，用于生成数据结构的一个美观视图。格式化工具会生成数据结构的一些表示，不仅可以由解释器正确地解析，而且便于人类阅读。输出尽可能放在一行上，分解为多行时则…

PHP中文网
编程技术 2025年2月28日
2000
利用QT写一个极简单的图形化Python闹钟程序

今天我们讲一下用python写的gui小程序。一个小闹钟（只是屏幕提示，没有声音哦）让我们先介绍这个闹钟如何奇葩。需要通过命令行启动。没有标题栏。没菜单。立即学习“Python免费学习笔记（深入）”；甚至没有关闭按钮。没有运行…

PHP中文网
编程技术 2025年2月28日
2000
编程技术

Python中尝试多线程编程的一个简明例子

综述多线程是程序设计中的一个重要方面，尤其是在服务器Deamon程序方面。无论何种系统，线程调度的开销都比传统的进程要快得多。 Python可以方便地支持多线程。可以快速创建线程、互斥锁、信号量等等元素，支持线程读写同步互斥。美中…

PHP中文网
2025年2月28日
2000
详解Python中的join()函数的用法

函数：string.join() Python中有join()和os.path.join()两个函数，具体作用如下： join()：连接字符串数组。将字符串、元组、列表中的元素以指定的字符(分隔符)连接生成一个新的字符串 …

PHP中文网
编程技术 2025年2月28日
2000
用Python实现一个简单的线程池

线程池的概念是什么？在面向对象编程中，创建和销毁对象是很费时间的，因为创建一个对象要获取内存资源或者其它更多资源。在Java中更是如此，虚拟机将试图跟踪每一个对象，以便能够在对象销毁后进行垃圾回收。所以提高服务程序效率的一个手段就是尽可…

PHP中文网
编程技术 2025年2月28日
2000
Python中用于去除空格的三个函数的使用小结

函数：strip() lstrip() rstrip() 作用：去除字符串中的空格或指定字符一、默认用法：去除空格str.strip() ：去除字符串两边的空格str.lstrip() ：去除字符串左边的空格str.rstrip…

PHP中文网
编程技术 2025年2月28日
2000
简单介绍Python中的len()函数的使用

函数：len() 1：作用：返回字符串、列表、字典、元组等长度 2：语法：len(str) 3：参数：str：要计算的字符串、列表、字典、元组等 4：返回值：字符串、列表、字典、元组等元素的长度 5：实例5.1、计算字符串的长度： >…

PHP中文网
编程技术 2025年2月28日
2000

发表回复

登录后才能评论

Python实现在线程里运行scrapy的方法

关于作者

AD推荐 黄金广告位招租... 更多推荐

相关推荐

发表回复

分享到:

请登录

AD推荐黄金广告位招租... 更多推荐