python爬蟲控制aiohttp并發(fā)數(shù)量方式
前言
在使用aiohttp并發(fā)訪問多個頁面時效率,明顯比串行requests快很多,
但是也存在一個問題,就是網(wǎng)站檢測到短時間內(nèi)請求的數(shù)量過多會導(dǎo)致頁面請求不成成功,
頁面返回429 (too many requests)。
解決上述問題
目前想到兩個方法
1、控制請求的時間,用sleep延時,來消耗每一次訪問的時間,減少單位時間內(nèi)的訪問量,這樣肯定是可以,但效率太低
2、控制并發(fā)數(shù)量,控制并發(fā)數(shù)量,普遍推薦用信號量來控制使用方法也比較簡單如下:
from asyncio import tasks
from aiohttp.client import ClientSession
from lxml import etree
from time import sleep
import time
import asyncio
import aiohttp
async def read_page_list(page_num,sem):
params = {
'page':page_num,
}
#通過連接池控制并發(fā)數(shù)量 limit 默認(rèn)為100 0 為無限制
async with sem:
try:
async with aiohttp.ClientSession() as session:
async with session.get(url=url,params=params,headers=headers) as response:
text = await response.text()
except Exception as e:
print('exception:',e)
tree = etree.HTML(text)
page_list = tree.xpath('//*[@id="thumbs"]/section[1]/ul/li')
# break
for li in page_list:
pic_small_url = li.xpath('.//img/@data-src')[0]
# print(pic_small_url,type(pic_small_url))
# pic_small_url = str(pic_small_url)
if 'small' in pic_small_url:
temp_url = pic_small_url.replace('small','full')
a = temp_url.rfind('/')
temp_url1= temp_url[:a]
pic_full_url = temp_url1+'/wallhaven-'+temp_url.split('/')[-1]
pic_full_url = pic_full_url.replace('th','w')
# print(page_num,pic_full_url)
pic_list.append(pic_full_url)
else:
print(page_num,'find small error',pic_small_url)
print(page_num,len(page_list),response.status)
# await asyncio.sleep(1)
#這里可以用硬延時來控制程序的訪問速度,進(jìn)而控制單位時間內(nèi)并發(fā)的數(shù)量
# sleep(0.5)
#定義信號量
sem = asyncio.Semaphore(2)
start = time.time()
#建立任務(wù)列表
tasks = [loop.create_task(read_page_list(i,sem)) for i in range(1,20)]
loop.run_until_complete(asyncio.wait(tasks))
print('get page list use time:',time.time()-start)
實驗結(jié)果
如下:
- 經(jīng)試驗只有當(dāng)請求頁面20個 sem=1時才不會出現(xiàn)服務(wù)器返回429.
- 當(dāng)把請求頁面數(shù)量改為10 sem=5是就不會出現(xiàn)服務(wù)返回429的情況
總結(jié)
以上為個人經(jīng)驗,希望能給大家一個參考,也希望大家多多支持腳本之家。
相關(guān)文章
Python 3.14 新特性實戰(zhàn)之模式匹配與性能優(yōu)化
這篇文章給大家介紹了Python 3.14 新特性實戰(zhàn)之模式匹配與性能優(yōu)化,本文結(jié)合實例代碼給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友參考下吧2026-05-05
Python?functools凍結(jié)參數(shù)小技巧實現(xiàn)代碼簡潔優(yōu)化
這篇文章主要為大家介紹了Python?functools凍結(jié)參數(shù)小技巧實現(xiàn)代碼簡潔優(yōu)化示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2023-12-12
tkinter如何實現(xiàn)打開文件對話框并獲取文件絕對路徑
這篇文章主要介紹了tkinter實現(xiàn)打開文件對話框并獲取文件絕對路徑問題,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教2023-01-01
Pycharm虛擬環(huán)境創(chuàng)建并使用命令行指定庫的版本進(jìn)行安裝
Pycharm創(chuàng)建的項目,使用了虛擬環(huán)境,對庫的版本進(jìn)行管理,有些項目的對第三方庫的版本要求不同,可使用虛擬環(huán)境進(jìn)行管理,直接想通過pip命令安裝可以參考下本文的操作步驟2022-07-07
Python實現(xiàn)matplotlib顯示中文的方法詳解
這篇文章主要介紹了Python實現(xiàn)matplotlib顯示中文的方法,結(jié)合實例形式詳細(xì)總結(jié)分析了Python使用matplotlib庫繪圖時顯示中文的相關(guān)操作技巧與注意事項,需要的朋友可以參考下2018-02-02

