最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python3直接爬取圖片URL并保存示例

 更新時(shí)間:2019年12月18日 10:07:31   作者:TelAntiNomy  
今天小編就為大家分享一篇Python3直接爬取圖片URL并保存示例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧

有時(shí)候我們會(huì)需要從網(wǎng)絡(luò)上爬取一些圖片,來滿足我們形形色色直至不可描述的需求。

一個(gè)典型的簡(jiǎn)單爬蟲項(xiàng)目步驟包括兩步:獲取網(wǎng)頁地址和提取保存數(shù)據(jù)。

這里是一個(gè)簡(jiǎn)單的從圖片url收集圖片的例子,可以成為一個(gè)小小的開始。

獲取地址

這些圖片的URL可能是連續(xù)變化的,如從001遞增到099,這種情況可以在程序中將共同的前面部分截取,再在最后遞增并字符串化后循環(huán)即可。

抑或是它們的URL都保存在某個(gè)文件中,這時(shí)可以讀取到列表中:

def getUrls(path):
  urls = []
  with open(path,'r') as f:
    for line in f:
      urls.append(line.strip('\n'))
  return(urls)

保存圖片

在python3中,urllib提供了一系列用于操作URL的功能,其中的request模塊可以非常方便地抓取URL內(nèi)容,也就是發(fā)送一個(gè)GET請(qǐng)求到指定的頁面,然后返回HTTP的響應(yīng)。具體細(xì)節(jié)請(qǐng)看注釋:

def requestImg(url, name, num_retries=3):
  img_src = url
  # print(img_src)
  header = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) \
    AppleWebKit/537.36 (KHTML, like Gecko) \
      Chrome/35.0.1916.114 Safari/537.36',
    'Cookie': 'AspxAutoDetectCookieSupport=1'
  }
  # Request類可以使用給定的header訪問URL
  req = urllib.request.Request(url=img_src, headers=header) 
  try:
    response = urllib.request.urlopen(req) # 得到訪問的網(wǎng)址
    filename = name + '.jpg'
    with open(filename, "wb") as f:
      content = response.read() # 獲得圖片
      f.write(content) # 保存圖片
      response.close()
  except HTTPError as e: # HTTP響應(yīng)異常處理
    print(e.reason)
  except URLError as e: # 一定要放到HTTPError之后,因?yàn)樗饲罢?
    print(e.reason)
  except IncompleteRead or RemoteDisconnected as e: 
    if num_retries == 0: # 重連機(jī)制
      return
    else:
      requestImg(url, name, num_retries-1)

其他

捕獲異常

以下是批量爬取網(wǎng)頁時(shí)可能需要捕獲的異常,同時(shí)可以看出,urllib2庫對(duì)應(yīng)urllib庫,而httplib庫對(duì)應(yīng)http.client:

Python2 Pyhton3
urllib2.HTTPError urllib.error.HTTPError
urllib2.URLError urllib.error.URLError (HTTPError被包含其中)
httplib.IncompleteRead http.client.IncompleteRead
httplib.RemoteDisconnected http.client.RemoteDisconnected

重連機(jī)制

在函數(shù)參數(shù)中設(shè)置一個(gè)參數(shù)num_retries并對(duì)其進(jìn)行初始化,即默認(rèn)參數(shù)。在某些異常出現(xiàn)時(shí)可以將該參數(shù)遞減,再讓它遞歸調(diào)用自身,這就是基本的重連機(jī)制。

修飾器

有種設(shè)計(jì)模式叫修飾器模式,它可以在不修改目標(biāo)函數(shù)代碼的前提下,在目標(biāo)函數(shù)執(zhí)行前后增加一些額外功能。

def clock(func): # 修飾器函數(shù),對(duì)函數(shù)計(jì)時(shí)
  def clocked(*args):
    t0 = timeit.default_timer()
    result = func(*args)
    elapsed = timeit.default_timer() - t0
    name = func.__name__
    arg_str = ', '.join(repr(arg) for arg in args)
    print('[%0.8fs] %s(%s)' % (elapsed, name, arg_str))
    # print('%s(%s) -> %r [%0.8fs]' % (name, arg_str, result, elapsed))
    return result
  return clocked

上面這段代碼是修飾器函數(shù)的一個(gè)例子,用來對(duì)函數(shù)運(yùn)行時(shí)間進(jìn)行計(jì)時(shí),在需要計(jì)時(shí)的函數(shù)上一行添加一點(diǎn)點(diǎn)代碼即可:

@clock

完整代碼

from urllib.error import HTTPError, URLError
from http.client import IncompleteRead, RemoteDisconnected
import timeit, time
import urllib.request
import socket
 
 
# timeout = 20
# socket.setdefaulttimeout(timeout) # 等待,防止被簡(jiǎn)單地反爬
 
 
def getUrls(path):
  urls = []
  with open(path,'r') as f:
    for line in f:
      urls.append(line.strip('\n'))
  return(urls)
 
 
def clock(func): # 修飾器函數(shù),對(duì)函數(shù)計(jì)時(shí)
  def clocked(*args):
    t0 = timeit.default_timer()
    result = func(*args)
    elapsed = timeit.default_timer() - t0
    name = func.__name__
    arg_str = ', '.join(repr(arg) for arg in args)
    print('[%0.8fs] %s(%s)' % (elapsed, name, arg_str))
    # print('%s(%s) -> %r [%0.8fs]' % (name, arg_str, result, elapsed))
    return result
  return clocked
 
 
@clock
def requestImg(url, name, num_retries=3):
  img_src = url
  # print(img_src)
  header = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) \
    AppleWebKit/537.36 (KHTML, like Gecko) \
      Chrome/35.0.1916.114 Safari/537.36',
    'Cookie': 'AspxAutoDetectCookieSupport=1'
  }
  req = urllib.request.Request(url=img_src, headers=header)
  try:
    response = urllib.request.urlopen(req)
    filename = name + '.jpg'
    with open(filename, "wb") as f:
      content = response.read()
      f.write(content)
      response.close()
  except HTTPError as e:
    print(e.reason)
  except URLError as e:
    print(e.reason)
  except IncompleteRead or RemoteDisconnected as e:
    if num_retries == 0:
      return
    else:
      requestImg(url, name, num_retries-1)
 
 
 
if __name__ =='__main__':
  urls = getUrls('./'URLS.txt') # 換成你的URL文件路徑
  nLines = len(urls)
  print(nLines)
  for index, value in enumerate(urls):
      requestImg(value, './'+str(index).zfill(6)) # zfill用來格式化數(shù)字:000001

以上這篇Python3直接爬取圖片URL并保存示例就是小編分享給大家的全部?jī)?nèi)容了,希望能給大家一個(gè)參考,也希望大家多多支持腳本之家。

相關(guān)文章

  • 一文掌握python中的時(shí)間包

    一文掌握python中的時(shí)間包

    這篇文章主要介紹了python中的時(shí)間包,主要包括datetime時(shí)間包,獲取當(dāng)前時(shí)間,獲取時(shí)間間隔及時(shí)間對(duì)象轉(zhuǎn)時(shí)間字符串的相關(guān)知識(shí),本文通過示例代碼給大家介紹的非常詳細(xì),需要的朋友可以參考下
    2022-08-08
  • Python實(shí)現(xiàn)繁體中文與簡(jiǎn)體中文相互轉(zhuǎn)換的方法示例

    Python實(shí)現(xiàn)繁體中文與簡(jiǎn)體中文相互轉(zhuǎn)換的方法示例

    這篇文章主要介紹了Python實(shí)現(xiàn)繁體中文與簡(jiǎn)體中文相互轉(zhuǎn)換的方法,涉及Python基于第三方模塊進(jìn)行編碼轉(zhuǎn)換相關(guān)操作技巧,需要的朋友可以參考下
    2018-12-12
  • Python編程修改MP3文件名稱的方法

    Python編程修改MP3文件名稱的方法

    這篇文章主要介紹了Python編程修改MP3文件名稱的方法,結(jié)合實(shí)例形式分析了Python修改文件名稱的相關(guān)操作技巧,需要的朋友可以參考下
    2017-04-04
  • 詳解Python字典的運(yùn)算

    詳解Python字典的運(yùn)算

    這篇文章主要為大家介紹了Python字典的運(yùn)算 ,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助
    2021-12-12
  • pyinstaller打包成無控制臺(tái)程序時(shí)運(yùn)行出錯(cuò)(與popen沖突的解決方法)

    pyinstaller打包成無控制臺(tái)程序時(shí)運(yùn)行出錯(cuò)(與popen沖突的解決方法)

    這篇文章主要介紹了pyinstaller打包成無控制臺(tái)程序時(shí)運(yùn)行出錯(cuò)(與popen沖突的解決方法),文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-04-04
  • python3文件復(fù)制、延遲文件復(fù)制任務(wù)的實(shí)現(xiàn)方法

    python3文件復(fù)制、延遲文件復(fù)制任務(wù)的實(shí)現(xiàn)方法

    這篇文章主要給大家介紹了關(guān)于python3文件復(fù)制、延遲文件復(fù)制任務(wù)的實(shí)現(xiàn)方法,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家學(xué)習(xí)或者使用python3具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面來一起學(xué)習(xí)學(xué)習(xí)吧
    2019-09-09
  • Python實(shí)現(xiàn)GPU加速的基本操作

    Python實(shí)現(xiàn)GPU加速的基本操作

    本文簡(jiǎn)單介紹了Python實(shí)現(xiàn)GPU加速的基本操作,文中運(yùn)用大量代碼講解的非常詳細(xì),有一定的參考價(jià)值,需要學(xué)習(xí)相關(guān)知識(shí)的小伙伴一起來看看吧
    2021-08-08
  • python爬蟲進(jìn)階之協(xié)程詳解

    python爬蟲進(jìn)階之協(xié)程詳解

    這篇文章主要介紹了python爬蟲進(jìn)階之協(xié)程詳解,coroutine中文翻譯叫協(xié)程,在 Python 中昌指代為協(xié)程對(duì)象類型,可以將協(xié)程對(duì)象注冊(cè)到時(shí)間循環(huán)中被調(diào)用,需要的朋友可以參考下
    2023-08-08
  • Python環(huán)境搭建過程從安裝到Hello World

    Python環(huán)境搭建過程從安裝到Hello World

    這篇文章主要介紹了Python環(huán)境搭建過程從安裝到Hello World,本文通過圖文并茂的形式給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2021-02-02
  • opencv3/C++ 平面對(duì)象識(shí)別&透視變換方式

    opencv3/C++ 平面對(duì)象識(shí)別&透視變換方式

    今天小編就為大家分享一篇opencv3/C++ 平面對(duì)象識(shí)別&透視變換方式,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2019-12-12

最新評(píng)論

永顺县| 抚州市| 宣汉县| 宁远县| 宝清县| 苏尼特右旗| 米脂县| 宜兰市| 万荣县| 黑龙江省| 福建省| 夏邑县| 尤溪县| 丹巴县| 平泉县| 当雄县| 泰和县| 松潘县| 临洮县| 武城县| 昌宁县| 屏南县| 钟山县| 富裕县| 布尔津县| 通道| 晋中市| 龙山县| 福安市| 栾城县| 大丰市| 苍山县| 威海市| 富民县| 黄龙县| 临夏市| 江西省| 台南县| 方正县| 荆门市| 佳木斯市|