最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python中使用urllib2模塊編寫(xiě)爬蟲(chóng)的簡(jiǎn)單上手示例

 更新時(shí)間:2016年01月20日 19:29:58   作者:chinajun  
這篇文章主要介紹了Python中使用urllib2模塊編寫(xiě)爬蟲(chóng)的簡(jiǎn)單上手示例,文中還介紹到了相關(guān)異常處理功能的添加,需要的朋友可以參考下

提起python做網(wǎng)絡(luò)爬蟲(chóng)就不得不說(shuō)到強(qiáng)大的組件urllib2。在python中正是使用urllib2這個(gè)組件來(lái)抓取網(wǎng)頁(yè)的。urllib2是Python的一個(gè)獲取URLs(Uniform Resource Locators)的組件。它以u(píng)rlopen函數(shù)的形式提供了一個(gè)非常簡(jiǎn)單的接口。通過(guò)下面的代碼簡(jiǎn)單感受一下urllib2的功能;

import urllib2 
response = urllib2.urlopen('http://www.baidu.com/') 
html = response.read() 
print html

運(yùn)行結(jié)果如下;

2016120192758123.jpg (685×440)

查看http://www.baidu.com/源代碼發(fā)現(xiàn)跟以上運(yùn)行結(jié)果完全一樣。這里的URL除了http:還可以是ftp:或file:
urllib2用一個(gè)Request對(duì)象來(lái)映射提出的HTTP請(qǐng)求。你可以創(chuàng)建一個(gè)Request對(duì)象,通過(guò)調(diào)用urlopen并傳入Request對(duì)象,將返回一個(gè)相關(guān)請(qǐng)求response對(duì)象,這個(gè)應(yīng)答對(duì)象如同一個(gè)文件對(duì)象,所以你可以在Response中調(diào)用.read()。修改代碼如下;

import urllib2 
req = urllib2.Request('http://www.baidu.com') 
response = urllib2.urlopen(req) 
page = response.read() 
print page

發(fā)現(xiàn)運(yùn)行結(jié)果跟修改前一樣。同時(shí)在http請(qǐng)求前你還需要做以下事1、發(fā)送表單數(shù)據(jù)。2、設(shè)置headers信息。
1、發(fā)送表單數(shù)據(jù);常見(jiàn)于模擬登錄時(shí),一般的在登錄操作時(shí)需要發(fā)送數(shù)據(jù)到服務(wù)器。這里主要用到post方法,一般的HTML表單,data需要編碼成標(biāo)準(zhǔn)形式。然后做為data參數(shù)傳到Request對(duì)象。編碼工作使用urllib的函數(shù)而非urllib2。測(cè)試代碼如下

import urllib 
import urllib2 
 
url = 'http://www.server.com/register.php' 
 
postData = {'useid' : 'user', 
   'pwd' : '***', 
   'language' : 'Python' } 
 
data = urllib.urlencode(postData) # 編碼工作 
req = urllib2.Request(url, data) # 發(fā)送請(qǐng)求同時(shí)傳data 
response = urllib2.urlopen(req) #接受反饋的信息 
page = response.read() #讀取反饋的內(nèi)容

同時(shí)urllib2還可以使用get方法傳送數(shù)據(jù)。代碼如下;

import urllib2 
import urllib 
 
data = {} 
 
data['useid'] = 'user' 
data['pwd'] = '***' 
data['language'] = 'Python' 
 
values = urllib.urlencode(data) 
print values 
 
name=Somebody+Here&language=Python&location=Northampton 
url = 'http://www.example.com/example.php' 
full_url = url + '?' + url_values 
 
data = urllib2.open(full_url)

2、設(shè)置headers信息;有些站點(diǎn)對(duì)訪問(wèn)來(lái)源做了限制,所以這里模擬User-Agent頭,代碼如下;

import urllib 
import urllib2 
 
url = 'http://www.server.com/register.php' 
 
user_agent = 'Mozilla/5.0 (Windows NT 6.1; rv:33.0) Gecko/20100101 Firefox/33.0' 
values = {'useid' : 'user', 
   'pwd' : '***', 
   'language' : 'Python' } 
 
headers = { 'User-Agent' : user_agent } 
data = urllib.urlencode(values) 
req = urllib2.Request(url, data, headers) 
response = urllib2.urlopen(req) 
page = response.read()

urllib2就介紹到這里啦!

異常處理
通常URLError在沒(méi)有網(wǎng)絡(luò)連接時(shí)或者服務(wù)器地址不可達(dá)時(shí)產(chǎn)生,在這種情況下異常會(huì)帶有resaon屬性包含了錯(cuò)誤號(hào)和錯(cuò)誤信息。如下代碼測(cè)試效果;

import urllib 
import urllib2 
 
url = 'http://www.server.com/register.php' 
 
user_agent = 'Mozilla/5.0 (Windows NT 6.1; rv:33.0) Gecko/20100101 Firefox/33.0' 
values = {'useid' : 'user', 
   'pwd' : '***', 
   'language' : 'Python' } 
 
headers = { 'User-Agent' : user_agent } 
data = urllib.urlencode(values) 
req = urllib2.Request(url, data, headers) 
response = urllib2.urlopen(req) 
page = response.read()

2016120192909586.png (685×301)

查閱相關(guān)資料后顯示Errno 10061表示服務(wù)器端主動(dòng)拒絕。
除此之外還有HTTPError,當(dāng)客戶端與服務(wù)器之間建立正常連接時(shí),urllib2將開(kāi)始處理相關(guān)數(shù)據(jù)。如果遇到不能處理的情況就會(huì)產(chǎn)生相應(yīng)的HTTPError,如網(wǎng)站訪問(wèn)常見(jiàn)的錯(cuò)誤碼”404″(頁(yè)面無(wú)法找到),”403″(請(qǐng)求禁止),和”401″(帶驗(yàn)證請(qǐng)求)等……HTTP狀態(tài)碼表示HTTP協(xié)議的響應(yīng)情況,常見(jiàn)的狀態(tài)碼見(jiàn)HTTP狀態(tài)碼詳解。
HTTPError會(huì)帶有一個(gè)'code'屬性,是服務(wù)器發(fā)送的錯(cuò)誤號(hào)。當(dāng)一個(gè)HTTPError產(chǎn)生后服務(wù)器會(huì)返回一個(gè)相關(guān)的錯(cuò)誤號(hào)和錯(cuò)誤頁(yè)面。如下代碼驗(yàn)證;

import urllib2 
 
req = urllib2.Request('http://www.python.org/callmewhy') 
 
try: 
 urllib2.urlopen(req) 
 
except urllib2.URLError, e: 
 
 print e.code 

2016120193000644.png (685×238)

輸出404代碼,說(shuō)明找不到頁(yè)面。
捕捉異常并處理……實(shí)現(xiàn)代碼如下;


#-*- coding:utf-8 -*-
from urllib2 import Request, urlopen, URLError, HTTPError
 
req = Request('http://www.python.org/callmewhy')
 
try: 
 
 response = urlopen(req) 
 
except URLError, e: 
 
 if hasattr(e, 'code'): 
 
  print '服務(wù)器不能正常響應(yīng)這個(gè)請(qǐng)求!' 
 
  print 'Error code: ', e.code 
 
 elif hasattr(e, 'reason'): 
 
  print '無(wú)法與服務(wù)器建立連接' 
 
  print 'Reason: ', e.reason 
 
 
else: 
 
 print '沒(méi)有出現(xiàn)異常'

2016120193030566.png (685×240)

成功捕捉到異常!

相關(guān)文章

  • 利用python設(shè)計(jì)圖像加密技術(shù)(Arnold算法)

    利用python設(shè)計(jì)圖像加密技術(shù)(Arnold算法)

    這篇文章主要介紹了利用python設(shè)計(jì)圖像加密技術(shù)(Arnold算法),本文將借助Arnold置亂法,講解如何用python從頭至尾設(shè)計(jì)出一套圖像加密算法,需要的小伙伴可以才參考一下
    2022-03-03
  • 淺析Python中常見(jiàn)數(shù)據(jù)脫敏技術(shù)應(yīng)用與對(duì)比

    淺析Python中常見(jiàn)數(shù)據(jù)脫敏技術(shù)應(yīng)用與對(duì)比

    數(shù)據(jù)脫敏通過(guò)對(duì)敏感數(shù)據(jù)進(jìn)行轉(zhuǎn)換,確保其在保護(hù)隱私的同時(shí)仍能用于開(kāi)發(fā),本文為大家整理了一些常見(jiàn)的數(shù)據(jù)脫敏技術(shù),感興趣的小伙伴可以了解下
    2025-02-02
  • python?pandas中的agg函數(shù)用法

    python?pandas中的agg函數(shù)用法

    這篇文章主要介紹了python?pandas中的agg函數(shù)用法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2022-05-05
  • python清除字符串中間空格的實(shí)例講解

    python清除字符串中間空格的實(shí)例講解

    今天小編就為大家分享一篇python清除字符串中間空格的實(shí)例講解,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2018-05-05
  • python logging通過(guò)json文件配置的步驟

    python logging通過(guò)json文件配置的步驟

    這篇文章主要介紹了python logging通過(guò)json文件配置的步驟,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2020-04-04
  • Python?munch包?/Munch()?的用法詳解

    Python?munch包?/Munch()?的用法詳解

    這篇文章主要介紹了Python?munch包?/Munch()?的用法,本文通過(guò)實(shí)例代碼給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2022-09-09
  • Python?內(nèi)置模塊?argparse快速入門教程

    Python?內(nèi)置模塊?argparse快速入門教程

    argparse模塊是Python內(nèi)置的用于命令項(xiàng)選項(xiàng)與參數(shù)解析的模塊,argparse模塊可以讓人輕松編寫(xiě)用戶友好的命令行接口,能夠幫助程序員為模型定義參數(shù),這篇文章主要介紹了快速入門Python內(nèi)置模塊argparse,需要的朋友可以參考下
    2023-06-06
  • 獲取python運(yùn)行輸出的數(shù)據(jù)并解析存為dataFrame實(shí)例

    獲取python運(yùn)行輸出的數(shù)據(jù)并解析存為dataFrame實(shí)例

    這篇文章主要介紹了獲取python運(yùn)行輸出的數(shù)據(jù)并解析存為dataFrame實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2020-07-07
  • Python中的各個(gè)多線程模塊之間的區(qū)別解析

    Python中的各個(gè)多線程模塊之間的區(qū)別解析

    Python中涉及多線程的主要模塊包括threading、thread和concurrent.futures,現(xiàn)代Python編程推薦使用threading和concurrent.futures,以提供更高層次的抽象和可用性,感興趣的朋友跟隨小編一起看看吧
    2024-09-09
  • Python獲取Cookie的方法總結(jié)

    Python獲取Cookie的方法總結(jié)

    在Web開(kāi)發(fā)中,Cookie是一種常用的技術(shù),用于在Web服務(wù)器和瀏覽器之間存儲(chǔ)和傳輸數(shù)據(jù),本文將詳細(xì)介紹Python中獲取Cookie的方法,包括HTTP請(qǐng)求、Web框架和Cookie管理庫(kù)的用法,同時(shí)提供示例代碼來(lái)演示這些方法的實(shí)際應(yīng)用,需要的朋友可以參考下
    2023-11-11

最新評(píng)論

文昌市| 公主岭市| 富顺县| 沙湾县| 和田市| 长兴县| 连平县| 达尔| 玉树县| 龙江县| 台中市| 南部县| 合江县| 阳朔县| 无为县| 寿光市| 黔南| 龙南县| 浑源县| 河北区| 林西县| 政和县| 高唐县| 梅州市| 咸丰县| 彭州市| 井研县| 莱州市| 西平县| 苏尼特右旗| 天峨县| 且末县| 枞阳县| 罗城| 依兰县| 保康县| 上杭县| 武胜县| 文化| 新昌县| 达尔|