python3中編碼獲取網(wǎng)頁(yè)的實(shí)例方法
學(xué)了python后,之前一些我們常用的方法,也可以換一種思路用python中的知識(shí)來(lái)解決。相信操作出來(lái)后,能收獲一大批小粉絲們。就像我們沒(méi)學(xué)習(xí)編程之前,看到那種大神都是可望而不可即。今天我們就之前簡(jiǎn)單獲取網(wǎng)頁(yè)的這種操作用python中的編碼來(lái)解決,大家可以自行體會(huì)一下兩者的不同。
1. encoding和apparent_encoding
import scrapy url="https://www.xxx.net/html/gndy/dyzz/index.html" re=requests.get(url) #獲取響應(yīng)頭Content-Type的charset值,有的網(wǎng)站沒(méi)有charset字段,就可能使用默認(rèn)的 ISO-8859-1 print(re.encoding) #apparent_encoding就是獲取網(wǎng)站真實(shí)的編碼 print(re.apparent_encoding)
2. 處理方案
直接用r.encoding = ‘xxx'
re.encoding='utf-8'
3. requests的text() 跟 content() 有什么區(qū)別
re.text返回的是處理過(guò)的Unicode型的數(shù)據(jù),
而使用re.content返回的是bytes型的原始數(shù)據(jù)。
4. 爬蟲(chóng)拿到的HTML和瀏覽器中的源碼不相同時(shí)
通過(guò)下載源碼對(duì)比
import requests
url = 'https://www.xxx.net/html/gndy/dyzz/index.html'
r = requests.get(url)
r.encoding = r.apparent_encoding
html = r.text
with open('test.html','w',encoding='utf8') as f:
f.write(html)

到此這篇關(guān)于python3中編碼獲取網(wǎng)頁(yè)的實(shí)例方法的文章就介紹到這了,更多相關(guān)python3中編碼如何獲取網(wǎng)頁(yè)內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
- Python 編碼規(guī)范(Google Python Style Guide)
- python 編碼規(guī)范整理
- Python 常用 PEP8 編碼規(guī)范詳解
- Python開(kāi)發(fā)編碼規(guī)范
- Python3 json模塊之編碼解碼方法講解
- 解決python3 中的np.load編碼問(wèn)題
- python源文件的字符編碼知識(shí)點(diǎn)詳解
- Python新建項(xiàng)目自動(dòng)添加介紹和utf-8編碼的方法
- 關(guān)于Python字符編碼與二進(jìn)制不得不說(shuō)的一些事
- 詳解Python中的編碼問(wèn)題(encoding與decode、str與bytes)
- Python2與Python3關(guān)于字符串編碼處理的差別總結(jié)
- Python 忽略文件名編碼的方法
- python基礎(chǔ)之編碼規(guī)范總結(jié)
相關(guān)文章
Python version 2.7 required, which was not found in the regi
這篇文章主要介紹了安裝PIL庫(kù)時(shí)提示錯(cuò)誤Python version 2.7 required, which was not found in the registry問(wèn)題的解決方法,需要的朋友可以參考下2014-08-08
Python抓取框架Scrapy爬蟲(chóng)入門(mén):頁(yè)面提取
Scrapy吸引人的地方在于它是一個(gè)框架,任何人都可以根據(jù)需求方便的修改,下面這篇文章主要給大家介紹了關(guān)于Python抓取框架Scrapy爬蟲(chóng)入門(mén)之頁(yè)面提取的相關(guān)資料,文中通過(guò)示例代碼介紹的非常詳細(xì),需要的朋友可以參考下。2017-12-12
Python+smtplib庫(kù)實(shí)現(xiàn)郵件發(fā)送功能
這篇文章主要為大家詳細(xì)介紹了Python如何通過(guò)smtplib庫(kù)實(shí)現(xiàn)簡(jiǎn)單的郵件發(fā)送功能,文中的示例代碼借鑒一下,有需要的小伙伴可以參考一下2025-02-02
Python 詳解通過(guò)Scrapy框架實(shí)現(xiàn)爬取百度新冠疫情數(shù)據(jù)流程
Scrapy是用純Python實(shí)現(xiàn)一個(gè)為了爬取網(wǎng)站數(shù)據(jù)、提取結(jié)構(gòu)性數(shù)據(jù)而編寫(xiě)的應(yīng)用框架,用途非常廣泛,框架的力量,用戶(hù)只需要定制開(kāi)發(fā)幾個(gè)模塊就可以輕松的實(shí)現(xiàn)一個(gè)爬蟲(chóng),用來(lái)抓取網(wǎng)頁(yè)內(nèi)容以及各種圖片,非常之方便2021-11-11
python3.8中關(guān)于sklearn問(wèn)題(win10)
這篇文章主要介紹了python3.8中關(guān)于sklearn問(wèn)題(win10),具有很好的參考價(jià)值,希望對(duì)大家有所幫助。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教2023-06-06
詳解Python的Django框架中Manager方法的使用
這篇文章主要介紹了Python的Django框架中Manager方法的使用,包括修改初始Manager QuerySets和增加額外的Manager方法等操作,需要的朋友可以參考下2015-07-07

