「来源: |<em>Python</em>爬虫与数据挖掘 ID:crawler_<em>python</em>」回复“Go语言”即可获赠从入门到进阶共10本电子书 今 日 鸡 汤 离离原上草,一岁一枯荣。一、前言 在Thread和Process中,应当优选Process,因为Proces
2021-05-24 10:30:27
「來源: |Python爬蟲與資料探勘 ID:crawler_python」
回覆「Go語言」即可獲贈從入門到進階共10本電子書
今
日
雞
湯
離離原上草,一歲一枯榮。
一、前言
在Thread和Process中,應當優選Process,因為Process更穩定,而且,Process可以分佈到多臺機器上,而Thread最多隻能分佈到同一臺機器的多個CPU上。
Python的multiprocessing模組不但支援多程序,其中managers子模組還支援把多程序分佈到多臺機器上。可以寫一個服務程序作為排程者,將任務分佈到其他多個程序中,依靠網路通訊進行管理。
二、案例分析
在做爬蟲程式時,抓取某個網站的所有圖片,如果使用多程序的話,一般是一個程序負責抓取圖片的連結地址,將連結地址放到queue中,另外的程序負責 從queue中取連結地址進行下載和儲存到本地。
怎麼用分散式程序實現?
一臺機器上的程序負責抓取連結地址,其他機器上的程序負責系在儲存。那麼遇到的主要問題是將queue 暴露到網路中,讓其他機器程序都可以訪問,分散式程序就是將這個過程進行了封裝,可以將這個過程稱為本地佇列的網路化。
例:
1.py
from multiprocessing.managers import BaseManagerfrom multiprocessing import freeze_support, Queue# 任務個數task_number = 10# 收發佇列task_quue = Queue(task_number)result_queue = Queue(task_number)defget_task():return task_quuedefget_result():return result_queue# 創建類似的queueManagerclassQueueManager(BaseManager):passdefwin_run():# 註冊在網路上,callable 關聯了Queue 物件# 將Queue物件在網路中暴露# window下繫結呼叫介面不能直接使用lambda,所以只能先定義函數再繫結 QueueManager.register('get_task_queue', callable=get_task) QueueManager.register('get_result_queue', callable=get_result)# 繫結埠和設定驗證口令 manager = QueueManager(address=('127.0.0.1', 8001), authkey='qiye'.encode())# 啟動管理,監聽資訊通道 manager.start()try:# 通過網路獲取任務佇列和結果佇列 task = manager.get_task_queue() result = manager.get_result_queue()# 新增任務for url in ["ImageUrl_" + str(i) for i in range(10)]: print('url is %s' % url) task.put(url) print('try get result')for i in range(10): print('result is %s' % result.get(timeout=10))except: print('Manager error')finally: manager.shutdown()if __name__ == '__main__': freeze_support() win_run()
連線伺服器,埠和驗證口令注意保持與伺服器程序中完全一致從網路獲取Queue,進行本地化,從task佇列獲取任務,並且把結果寫入result佇列
2.py
#coding:utf-8import timefrom multiprocessing.managers import BaseManager# 創建類似的Manager:classManager(BaseManager):pass#使用QueueManager註冊獲取Queue的方法名稱Manager.register('get_task_queue')Manager.register('get_result_queue')#連線到伺服器:server_addr = '127.0.0.1'print('Connect to server %s...' % server_addr)# 埠和驗證口令注意保持與服務程序設定的完全一致:m = Manager(address=(server_addr, 8001), authkey='qiye')# 從網路連線:m.connect()#獲取Queue的物件:task = m.get_task_queue()result = m.get_result_queue()#從task佇列取任務,並把結果寫入result佇列:while(not task.empty()): image_url = task.get(True,timeout=5) print('run task download %s...' % image_url) time.sleep(1) result.put('%s--->success'%image_url)#結束:print('worker exit.')
任務程序要通過網路連線到服務程序,所以要指定服務程序的IP。
運行結果如下:
獲取圖片地址,將地址傳到2.py。
接收1.py傳遞的地址,進行圖片的下載,控制檯顯示爬取結果。
三、總結
本文基於Python基礎,Python的分散式程序介面簡單,封裝良好,適合需要把繁重任務分佈到多臺機器的環境下。通過講解Queue的作用是用來傳遞任務和接收結果。
歡迎大家積極嘗試,有時候看到別人實現起來很簡單,但是到自己動手實現的時候,總會有各種各樣的問題,切勿眼高手低,勤動手,才可以理解的更加深刻。
-------------------End -------------------
相關文章
「来源: |<em>Python</em>爬虫与数据挖掘 ID:crawler_<em>python</em>」回复“Go语言”即可获赠从入门到进阶共10本电子书 今 日 鸡 汤 离离原上草,一岁一枯荣。一、前言 在Thread和Process中,应当优选Process,因为Proces
2021-05-24 10:30:27
让我们以陌生人的身份再次认识一下吧。Let's meet again as a stranger.心里所想的,才是心之所向的。What I think in my heart is what I want.总有那么一句话,会让你瞬间落泪。There is always a <em>word</em> t
2021-05-24 10:30:17
5月20日,大家是否有人和小编是在办公中度过呢!今天这个充满甜蜜的节日,你们是否和你的另一半在一起呢?那么我们就在今天这个节日中来学习<em>word</em>文档中所使用到的快捷键,那么给大家扩展一个小技巧。那么就是软件打开
2021-05-24 10:30:02
一 具体来说,根据互联网上的公开资料显示,联想拯救者电竞手机 2 Pro 于 2021年4 月 9 日上市,搭载高通骁龙 888 芯片。按照介绍,高通骁龙 888处理器基于三星 5nm 工艺制成, <em>CPU</em> 采用 1 x 2.84GHz (ARM 最新 Corte
2021-05-24 10:02:04
内置全新线性质阵列麦克风,采用独立DSP芯片专门处理语音算法,无需消耗<em>CPU</em>资源,让整机系统运行更流畅,同时,在息屏待命时,全程无需启动<em>CPU</em>,提升语音体验的同时更大幅度的降低电视功耗,省电又环保。TrensAI
2021-05-24 10:01:56
最近他设法在没有安装散热器的环境下,成功开机运行电脑,<em>CPU</em>是i5-11400,在开机之后,他使用热像仪捕获了<em>CPU</em>封装内部发生的情况,从而看到内核运作的过程。 不过在没有任何散热的情况下,不对<em>CPU</
2021-05-24 10:01:52