python爬蟲教程之bs4解析和xpath解析詳解
bs4解析
原理:
1.實例化一個BeautifulSoup對象,并且將頁面源碼數(shù)據(jù)加載到該對象中
2.通過調(diào)用BeautifulSoup對象中相關(guān)的屬性或者方法進行標(biāo)簽定位和數(shù)據(jù)提取
如何實例化BeautifulSoup對象:
from bs4 import BeautifulSoup
BeautifulSoup(參數(shù)一,參數(shù)二)
參數(shù)一為文件描述符,參數(shù)二為解析器,一般為’lxml’
一對象的實例化:
1.將本地的html文檔中的數(shù)據(jù)加載到該對象中
fp = open( './test.html','r',encoding='utf-8') soup=BeautifulSoup(fp,'lxml')
2.將互聯(lián)網(wǎng)上獲取的頁面源碼加載到該對象中
page_text =response.text soup=BeatifulSoup(page_text,'lxml')
soup指初始化的BeautifulSoup對象
用于數(shù)據(jù)解析的方法和屬性:
1.soup.tagName:返回的是文檔中第一次出現(xiàn)的tagName對應(yīng)的標(biāo)簽
2.soup.find():
(1).find( ‘tagName’):等同于soup.tagName
(2).屬性定位:soup.find(‘div’,class_/id/或者其他屬性=‘song’)
定位到< div class=“song”>/< div id=“song”>的標(biāo)簽下
class如果沒有加_則代表關(guān)鍵字
3.soup.find_all(‘tagName’):返回符合要求的所有標(biāo)簽(列表)
soup對象:
<div class="tang">
<ul>
<li><a rel="external nofollow" title= "ging">清明時節(jié)雨紛紛,路上行人欲斷魂,借問酒家何處有,牧童遙指杏花村</a></1i>
<li><a rel="external nofollow" title="qin">秦時明月漢時關(guān),萬里長征人未還,但使龍城飛將在,不教胡馬度陰山</a></1i>
<li><a href=" http://ww.126.com" rel="external nofollow" alt="qi ">歧王宅里尋常見,崔九堂前幾度聞,正是江南好風(fēng)景,落花時節(jié)又逢君</a></li>
<li><a href="http: //www.sina.com" rel="external nofollow" class="du">杜甫</a></li>
<li><a rel="external nofollow" class="du">杜牧</a></li>
<li><b>杜小月</b></li>
<li><i>度蜜月</i></li>
<li><a rel="external nofollow" feng">鳳凰臺上鳳凰游,鳳去臺空江自流,吳宮花草埋幽徑,晉代衣冠成古丘</a></li>
</ul>
</div>4.select:
- select(‘某種選擇器(id,class,標(biāo)簽…選擇器)’),返回的是一個列表。
標(biāo)簽什么都不加,class前面加. id前面加#
層級選擇器:
>表示的是一個層級;空格表示的多個層級
soup.select( '.tang > ul > li > a')
soup.select( '.tang >ul a')
結(jié)果為:[<a title= "ging">清明時節(jié)雨紛紛,路上行人欲斷魂,借問酒家何處有,牧童遙指杏花村</a>,
<a title="qin">秦時明月漢時關(guān),萬里長征人未還,但使龍城飛將在,不教胡馬度陰山</a>,
<a href=" http://ww.126.com"alt="qi ">歧王宅里尋常見,崔九堂前幾度聞,正是江南好風(fēng)景,落花時節(jié)又逢君</a>,
<a href="http: //www.sina.com" class="du">杜甫</a>,
<a class="du">杜牧</a>,
<a >鳳凰臺上鳳凰游,鳳去臺空江自流,吳宮花草埋幽徑,晉代衣冠成古丘</a>]
5.獲取標(biāo)簽之間的文本數(shù)據(jù):
-soup.a.text/string/get_text()
-text/get_text():可以獲取某一個標(biāo)簽中所有的文本內(nèi)容
-string:只可以獲取該標(biāo)簽下面直系的文本內(nèi)容
6.獲取標(biāo)簽中屬性值:
soup.a[‘屬性值’]
print(soup.select( '.tang > ul > li > a') [0]['href']) 結(jié)果: www.baidu.com
xpath解析
最常用且最便捷高效的一種解析方式。通用性。
xpath解析原理:
1.實例化一個etree的對象,且需要將被解析的頁面源碼數(shù)據(jù)加載到該對象中。
2調(diào)用etree對象中的xpath方法結(jié)合著xpath表達式實現(xiàn)標(biāo)簽的定位和內(nèi)容的捕獲。
實例化一個etree對象:
from lxml import etree
-1.將本地的html文檔中的源碼數(shù)據(jù)加載到etree對象中:
etree.parse(filePath)
-2.可以將從互聯(lián)網(wǎng)上獲取的源碼數(shù)據(jù)加載到該對象中
etree.HTML( 'page_text')
xpath( ‘xpath表達式’)
xpath表達式:(返回一個列表)
-/:表示的是從根節(jié)點開始定位。表示的是一個層級。
-//:表示的是多個層級。可以表示從任意位置開始定位。
-屬性定位://div[@class=‘song’] tag[@attrname=‘attrvalue’]
-索引定位://div[@class=‘song’]/p[3]
索引從1開始的
取文本:
- /text()獲取的是標(biāo)簽中直系的文本內(nèi)容
- //text(標(biāo)簽中非直系的文本內(nèi)容(所有的文本內(nèi)容)
取屬性:
- /@attrName
- eg:/img/@src
- ./表示定位到當(dāng)前位置(局部解析)
多個xpath之間用|分割:
- tree.xpath(’//div[@class=‘song’]/p[3] | //div[@class=‘song’]’)
總結(jié)
到此這篇關(guān)于python爬蟲教程之bs4解析和xpath解析的文章就介紹到這了,更多相關(guān)python bs4和xpath解析內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
淺談Python 命令行參數(shù)argparse寫入圖片路徑操作
這篇文章主要介紹了淺談Python 命令行參數(shù)argparse寫入圖片路徑操作,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2020-07-07
python簡易實現(xiàn)任意位數(shù)的水仙花實例
今天小編就為大家分享一篇python簡易實現(xiàn)任意位數(shù)的水仙花實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2018-11-11
如何使用Python 抓取和優(yōu)化所有網(wǎng)站圖像
我發(fā)布了一個通過FTP自動優(yōu)化新圖像的教程。這次我們將抓取整個網(wǎng)站,并在本地優(yōu)化我們遇到的圖像,按URL組織,怎么來操作呢,下面跟隨小編一起學(xué)習(xí)使用Python 抓取和優(yōu)化所有網(wǎng)站圖像的方法,感興趣的朋友一起看看吧2023-02-02
爬蟲代理池Python3WebSpider源代碼測試過程解析
這篇文章主要介紹了爬蟲代理池Python3WebSpider源代碼測試過程解析,文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下2019-12-12
python設(shè)計并實現(xiàn)平面點類Point的源代碼
這篇文章主要介紹了python-設(shè)計并實現(xiàn)平面點類Point,定義一個平面點類Point,對其重載運算符關(guān)系運算符,關(guān)系運算以距離坐標(biāo)原點的遠近作為基準(zhǔn),需要的朋友可以參考下2024-05-05

