Python爬蟲之requests基礎(chǔ)用法詳解
requests庫介紹
雖然Python的標(biāo)準(zhǔn)庫中urllib模塊已經(jīng)包含了平常我們使用的大多數(shù)功能,但是它的API使用起來讓人感覺不太友好,而requests庫宣傳是“HTTP for Human”,說明使用更簡潔方便。由于requests庫不是標(biāo)準(zhǔn)庫,所以我們首先需要安裝這個(gè)requests庫。
requests的安裝和文檔地址
利用 pip 命令可以非常方便您的安裝:
pip install requests
中文文檔:https://2.python-requests.org//zh_CN/latest/index.html
發(fā)送get請(qǐng)求
發(fā)送GET請(qǐng)求,直接調(diào)用requests.get()就可以了,想要發(fā)送什么類型的請(qǐng)求,就調(diào)用什么方法。
代碼示例:
# 引入requests庫
import requests
# 向指定的url發(fā)送請(qǐng)求,并返回
url = 'https://www.baidu.com/'
# 發(fā)送get請(qǐng)求
req = requests.get(url=url)
# 響應(yīng)內(nèi)容
print('狀態(tài)碼:', req.status_code)
print('請(qǐng)求地址:', req.url)
print('當(dāng)前編碼:', req.encoding)
# req.encoding = 'utf-8' # 設(shè)置編碼
# 以encoding解析返回內(nèi)容。字符串方式的響應(yīng)體,會(huì)自動(dòng)根據(jù)響應(yīng)頭部的字符編碼進(jìn)行解碼
print('內(nèi)容1:', req.text)
# 以字節(jié)形式(二進(jìn)制)返回。字節(jié)方式的響應(yīng)體,會(huì)自動(dòng)為你解碼 gzip 和deflate 壓縮。
print('內(nèi)容2:', req.content)
# print('內(nèi)容2:', req.content.decode())
# 以字典對(duì)象存儲(chǔ)服務(wù)器響應(yīng)頭,但是這個(gè)字典比較特殊,字典鍵不區(qū)分大小寫,若鍵不存在則返回None
print('headers:', req.headers)
# 返回原始響應(yīng)體,也就是 urllib 的 response 對(duì)象,使用 使用 r.raw.read()
print('原始響應(yīng)體:', req.raw)
# print(req.raw.read())
發(fā)送post請(qǐng)求
發(fā)送POST請(qǐng)求也是非常簡單,直接調(diào)用requests.post()就可以了;如果返回的是json數(shù)據(jù),那么可以使用response.json()來將json字符串轉(zhuǎn)換為字典或者列表。
代碼示例:
# 引入requests庫
import requests
# 聲明定義請(qǐng)求頭
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.110 Safari/537.36',
}
# 請(qǐng)求地址
post_url = 'https://fanyi.baidu.com/sug'
# 參數(shù)
form_data = {
'kw': 'honey'
}
# 進(jìn)行post請(qǐng)求
req = requests.post(url=post_url, data=form_data, headers=headers)
# 響應(yīng)內(nèi)容
print('狀態(tài)碼:', req.status_code)
print('請(qǐng)求地址:', req.url)
print('當(dāng)前編碼:', req.encoding)
# req.encoding = 'utf-8' # 設(shè)置編碼
# 以encoding解析返回內(nèi)容。字符串方式的響應(yīng)體,會(huì)自動(dòng)根據(jù)響應(yīng)頭部的字符編碼進(jìn)行解碼
print('內(nèi)容1:', req.text)
# 以字節(jié)形式(二進(jìn)制)返回。字節(jié)方式的響應(yīng)體,會(huì)自動(dòng)為你解碼 gzip 和deflate 壓縮。
print('內(nèi)容2:', req.content)
# print('內(nèi)容2:', req.content.decode())
# 以字典對(duì)象存儲(chǔ)服務(wù)器響應(yīng)頭,但是這個(gè)字典比較特殊,字典鍵不區(qū)分大小寫,若鍵不存在則返回None
print('headers:', req.headers)
# 返回原始響應(yīng)體,也就是 urllib 的 response 對(duì)象,使用 使用 r.raw.read()
print('原始響應(yīng)體:', req.raw)
# print(req.raw.read())
# 返回json對(duì)象
print('json:', req.json())
requests異常處理
我們?cè)趯?shí)際使用過程中,可能會(huì)遇到網(wǎng)絡(luò)的各種變化會(huì)導(dǎo)致請(qǐng)求過程發(fā)生各種未知的錯(cuò)誤導(dǎo)致程序中斷,這就使我們的程序不能很好的去處理錯(cuò)誤。所以為了使我們的程序在請(qǐng)求時(shí)遇到錯(cuò)誤,可以捕獲這種錯(cuò)誤,就要用到try…except方法,以及了解requests可能發(fā)生的各種錯(cuò)誤。
import requests
url = 'http://www.b.com'
try:
req = requests.get(url=url)
print(req.text)
except requests.exceptions.ConnectionError as e:
print(e)
except requests.exceptions.ChunkedEncodingError as e:
print(e)
except requests.exceptions.HTTPError as e:
print(e)
response的一些屬性
上面的代碼例子中已經(jīng)有說明,在此再列舉一遍。
# 響應(yīng)內(nèi)容
print('狀態(tài)碼:', req.status_code)
print('請(qǐng)求地址:', req.url)
print('當(dāng)前編碼:', req.encoding)
# req.encoding = 'utf-8' # 設(shè)置編碼
# 以encoding解析返回內(nèi)容。字符串方式的響應(yīng)體,會(huì)自動(dòng)根據(jù)響應(yīng)頭部的字符編碼進(jìn)行解碼
print('內(nèi)容1:', req.text)
# 以字節(jié)形式(二進(jìn)制)返回。字節(jié)方式的響應(yīng)體,會(huì)自動(dòng)為你解碼 gzip 和deflate 壓縮。
print('內(nèi)容2:', req.content)
# print('內(nèi)容2:', req.content.decode())
# 以字典對(duì)象存儲(chǔ)服務(wù)器響應(yīng)頭,但是這個(gè)字典比較特殊,字典鍵不區(qū)分大小寫,若鍵不存在則返回None
print('headers:', req.headers)
# 返回原始響應(yīng)體,也就是 urllib 的 response 對(duì)象,使用 使用 r.raw.read()
print('原始響應(yīng)體:', req.raw)
# print(req.raw.read())
# 獲取返回的json數(shù)據(jù)
print('json:', req.json())
- response.content:這個(gè)是直接從網(wǎng)絡(luò)上面抓取的數(shù)據(jù),沒有經(jīng)過任何解碼,所以是一個(gè)butes類型,其實(shí)在硬盤上和網(wǎng)絡(luò)上傳輸?shù)淖址际莃ytes類型。
- response.text:這個(gè)是string的數(shù)據(jù)類型,是requests庫將response.content進(jìn)行解碼的字符串,解碼需要指定一個(gè)編碼方式,requests回根據(jù)自己的請(qǐng)求來判斷解碼方式,所以有時(shí)候可能會(huì)由于解碼方式不同產(chǎn)生亂碼,這時(shí)候就應(yīng)該使用response.content.decode('utf-8')繼續(xù)手動(dòng)解碼。
到此這篇關(guān)于Python爬蟲之requests基礎(chǔ)用法詳解的文章就介紹到這了,更多相關(guān)Python的requests基礎(chǔ)用法內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
python ndarray數(shù)組對(duì)象特點(diǎn)及實(shí)例分享
在本篇文章里小編給大家分享的是一篇關(guān)于python ndarray數(shù)組對(duì)象特點(diǎn)及實(shí)例相關(guān)內(nèi)容,有需要的朋友們跟著學(xué)習(xí)下。2021-10-10
python爬蟲學(xué)習(xí)筆記之pyquery模塊基本用法詳解
這篇文章主要介紹了python爬蟲學(xué)習(xí)筆記之pyquery模塊基本用法,結(jié)合實(shí)例形式詳細(xì)分析了python爬蟲pyquery模塊基本功能、用法及操作注意事項(xiàng),需要的朋友可以參考下2020-04-04
解決Linux系統(tǒng)中python matplotlib畫圖的中文顯示問題
這篇文章主要介紹了解決Linux系統(tǒng)中python matplotlib畫圖的中文顯示問題,需要的朋友可以參考下2017-06-06
Tensorflow加載模型實(shí)現(xiàn)圖像分類識(shí)別流程詳解
在視覺領(lǐng)域可以分為:1、圖像分類 2、語義分割 3、實(shí)例分割 4、目標(biāo)檢測(cè)(跟蹤) 5、關(guān)鍵點(diǎn)檢測(cè)。該篇主要講解利用Tensorflow 對(duì)圖像進(jìn)行圖像分類2022-09-09
OpenCV實(shí)現(xiàn)將兩幅圖像拼在一起(Python)
本文介紹了使用Numpy庫中的np.concatenate函數(shù)進(jìn)行數(shù)組拼接的方法,通過示例說明了當(dāng)axis為0時(shí)進(jìn)行縱向拼接,axis為1時(shí)進(jìn)行橫向拼接,還umpy拼接圖片的代碼實(shí)現(xiàn)也進(jìn)行了闡述,注意interval參數(shù)的設(shè)定,適用于單色的圖拼接2026-05-05
Python爬取動(dòng)態(tài)網(wǎng)頁中圖片的完整實(shí)例
這篇文章主要給大家介紹了關(guān)于Python爬取動(dòng)態(tài)網(wǎng)頁中圖片的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2021-03-03

