最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python網(wǎng)絡(luò)爬蟲精解之XPath的使用說明

 更新時間:2021年09月27日 08:38:19   作者:小狐貍夢想去童話鎮(zhèn)  
XPath 是一門在 XML 文檔中查找信息的語言。XPath 可用來在 XML 文檔中對元素和屬性進(jìn)行遍歷。XPath 是 W3C XSLT 標(biāo)準(zhǔn)的主要元素,并且 XQuery 和 XPointer 都構(gòu)建于 XPath 表達(dá)之上

XPath的使用

一、XPath的介紹

XPath的幾個常用規(guī)則:

表達(dá)式 描述
nodename 選取此節(jié)點的所有子節(jié)點
/ 從當(dāng)前節(jié)點選取直接子節(jié)點
// 從當(dāng)前節(jié)點選取子孫節(jié)點
. 選取當(dāng)前節(jié)點
選取當(dāng)前節(jié)點的父節(jié)點
@ 選取屬性

二、XPath使用

1、選取所有節(jié)點

test01.html

<book class="item">
  <title lang="en" class="item-01">Harry Potter</title>
  <author class="item-02 name">J K. Rowling</author> 
  <year>2005</year>
  <price>29.99</price>
</book>
from lxml import etree

html = etree.parse('./test01.html',etree.HTMLParser())
result = html.xpath('//*')
print(result)

運行程序后得到一個列表:

[<Element html at 0x2252aff0d88>, <Element body at 0x2252aff0e48>, <Element book at 0x2252aff0e88>, <Element title at 0x2252aff0ec8>, <Element author at 0x2252aff0f08>, <Element year at 0x2252aff0f88>, <Element price at 0x2252aff0fc8>]

列表中每個元素代表原test01.html文件中的節(jié)點,可以看出節(jié)點有html、body、book、title、author、year、price節(jié)點。

2、獲取子節(jié)點

如果想要獲取book節(jié)點下的author節(jié)點,則可將代碼編寫為:

from lxml import etree

html = etree.parse('./test01.html',etree.HTMLParser())
result = html.xpath('//author')
print(result)

這樣僅可獲得author節(jié)點:[<Element author at 0x2252aef8748>]

3、獲取父節(jié)點

獲取當(dāng)前節(jié)點的父節(jié)點,主要是父節(jié)點的屬性值。

以獲取父節(jié)點book的class屬性值為例。

from lxml import etree
html = etree.parse('./test01.html',etree.HTMLParser())
result = html.xpath('//title[@class="item-01"]/../@class') #獲取title節(jié)點的父節(jié)點的class屬性值
print(result)

【運行結(jié)果】

['item']

通過查閱之前test01.html的源碼可知,父節(jié)點book的class屬性值為“item”。

4、屬性匹配

我們知道每個節(jié)點幾乎都帶有屬性,通過屬性匹配我們可以匹配具有相同節(jié)點名但屬性不同的節(jié)點。

通常是將需要匹配的屬性放在中括號內(nèi)。

例如,用屬性匹配的方式獲取title節(jié)點。

from lxml import etree
html = etree.parse('./test01.html',etree.HTMLParser())
result = html.xpath('//title[@lang="en"]')
print(result)

【運行結(jié)果】

[<Element title at 0x2252afb2a48>]

則得到了title節(jié)點。

5、文本獲取

一般我們爬取的內(nèi)容都是文本形式,我們使用text()方式將文本內(nèi)容提取出來。

在上一個實例的基礎(chǔ)上,我們獲取標(biāo)題的具體內(nèi)容。

from lxml import etree
html = etree.parse('./test01.html',etree.HTMLParser())
result = html.xpath('//title[@lang="en"]/text()')
print(result)

【運行結(jié)果】

['Harry Potter']

這樣我們就得到了具體的標(biāo)題名稱。

6、屬性獲取

有時候我們想要的數(shù)據(jù)不在文本內(nèi)容,而是在節(jié)點的屬性值里,因此我們還需要學(xué)會獲取節(jié)點的屬性值。

常用方式是在需要獲取的屬性值前面加@符號即可。

例如,我們獲取標(biāo)題title的lang和class這兩個屬性值。

from lxml import etree
html = etree.parse('./test01.html',etree.HTMLParser())
result = html.xpath('//title/@lang')
result.append(html.xpath('//title/@class')[0])
print(result)

【運行結(jié)果】

['en', 'item-01']

這樣我們就完成了屬性值的獲取。

7、屬性多值匹配

有時候?qū)傩灾挡⒉恢挥幸粋€,而是具有多個屬性值,像實例中author節(jié)點的class屬性值,具有兩個值item-02和name,通常我們在匹配時使用contains()方法,該方法的第一個參數(shù)傳入屬性名稱,第二個參數(shù)傳入屬性值(多個屬性值中的任意一個)。

我們以獲取作者姓名為例:

from lxml import etree
html = etree.parse('./test01.html',etree.HTMLParser())
result = html.xpath('//author[contains(@class,name)]/text()')
print(result)

【運行結(jié)果】

['J K. Rowling']

8、多屬性匹配

一個節(jié)點通常會有多個屬性,例如實例中的title節(jié)點,就具有l(wèi)ang和class節(jié)點,在進(jìn)行多屬性匹配時,使用and符來連接。

from lxml import etree
html = etree.parse('./test01.html',etree.HTMLParser())
result = html.xpath('//title[@lang="en" and @class="item-01"]/text()')
print(result)

【運行結(jié)果】

['Harry Potter']

以下是常見的運算符:

[外鏈圖片轉(zhuǎn)存失敗,源站可能有防盜鏈機(jī)制,建議將圖片保存下來直接上傳(img-GyHoIIVB-1631169770821)(D:\Users\31156\Desktop\網(wǎng)絡(luò)爬蟲\img\img11.jpg)]

9、按序選擇

實例test02.html

<bookstore>
<book>
  <title lang="eng">Harry Potter</title>
  <price>29.99</price>
</book>
<book>
  <title lang="eng">Learning XML</title>
  <price>39.95</price>
</book>
</bookstore>

我們還是按照之前講的,獲取book節(jié)點下的title名。

from lxml import etree
html = etree.parse('./test02.html',etree.HTMLParser())
result = html.xpath('//book/title/text()')
print(result)

【運行結(jié)果】

['Harry Potter', 'Learning XML']

這時我們看到有兩個標(biāo)題名,在處理時,我們可以在中括號中傳入索引獲取指定次序的節(jié)點。

獲取依次節(jié)點的值:

from lxml import etree
html = etree.parse('./test02.html',etree.HTMLParser())
result1 = html.xpath('//book[1]/title/text()')
result2 = html.xpath('//book[2]/title/text()')
print(result1)
print(result2)

【運行結(jié)果】

['Harry Potter']
['Learning XML']

還有一些其他方法,例如獲取最后一個節(jié)點用last()等,其他操作函數(shù)可參考:XPath函數(shù)

10、節(jié)點軸選擇

在這里插入圖片描述

這些節(jié)點軸可以幫助我們更快速的進(jìn)行匹配。

到此這篇關(guān)于python網(wǎng)絡(luò)爬蟲精解之XPath的使用說明的文章就介紹到這了,更多相關(guān)python XPath內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • Python基于遞歸實現(xiàn)電話號碼映射功能示例

    Python基于遞歸實現(xiàn)電話號碼映射功能示例

    這篇文章主要介紹了Python基于遞歸實現(xiàn)電話號碼映射功能,結(jié)合實例形式分析了Python針對字典的遞歸、遍歷相關(guān)操作技巧,需要的朋友可以參考下
    2018-04-04
  • 如何在sublime編輯器中安裝python

    如何在sublime編輯器中安裝python

    這篇文章主要介紹了如何在sublime編輯器中安裝python,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下
    2020-05-05
  • 利用python繪制笛卡爾直角坐標(biāo)系

    利用python繪制笛卡爾直角坐標(biāo)系

    這篇文章主要介紹了利用python繪制笛卡爾直角坐標(biāo)系,python繪圖主要用到matplotlib繪圖模塊,利用matplotlib模塊畫出上面的正弦函,需要的朋友可以參考一下
    2022-03-03
  • python list 切片倒著取的實現(xiàn)示例

    python list 切片倒著取的實現(xiàn)示例

    切片操作非常靈活,可以按照需要獲取列表中的任意一段元素,本文主要介紹了python list 切片倒著取的實現(xiàn)示例,具有一定的參考價值,感興趣的可以了解一下
    2024-01-01
  • 用OpenCV將視頻分解成單幀圖片,圖片合成視頻示例

    用OpenCV將視頻分解成單幀圖片,圖片合成視頻示例

    今天小編就為大家分享一篇用OpenCV將視頻分解成單幀圖片,圖片合成視頻示例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-12-12
  • Python從文件中讀取指定的行以及在文件指定位置寫入

    Python從文件中讀取指定的行以及在文件指定位置寫入

    這篇文章主要給大家介紹了關(guān)于Python從文件中讀取指定的行及在文件中指定位置寫入的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),對大家學(xué)習(xí)或者使用Python具有一定的參考學(xué)習(xí)價值,需要的朋友們下面來一起學(xué)習(xí)學(xué)習(xí)吧
    2019-09-09
  • python實現(xiàn)比較文件內(nèi)容異同

    python實現(xiàn)比較文件內(nèi)容異同

    這篇文章主要為大家詳細(xì)介紹了python實現(xiàn)比較文件內(nèi)容異同,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2018-06-06
  • python繪制餅圖和直方圖的方法

    python繪制餅圖和直方圖的方法

    這篇文章主要為大家詳細(xì)介紹了python繪制餅圖和直方圖的方法,文中示例代碼介紹的非常詳細(xì),具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2022-04-04
  • python中使用序列的方法

    python中使用序列的方法

    這篇文章主要介紹了python中使用序列的方法,較為詳細(xì)的分析了Python序列的原理與使用技巧,具有一定參考借鑒價值,需要的朋友可以參考下
    2015-08-08
  • 使用相同的Apache實例來運行Django和Media文件

    使用相同的Apache實例來運行Django和Media文件

    這篇文章主要介紹了使用相同的Apache實例來運行Django和Media文件,Django是最具人氣的Python web開發(fā)框架,需要的朋友可以參考下
    2015-07-07

最新評論

兴文县| 盐边县| 霍州市| 昌宁县| 运城市| 武夷山市| 六枝特区| 南宫市| 蛟河市| 星子县| 大竹县| 礼泉县| 嘉兴市| 泸溪县| 勐海县| 都安| 苗栗市| 临清市| 社会| 灌云县| 津市市| 灵川县| 徐闻县| 余庆县| 化德县| 灵寿县| 石泉县| 安化县| 溧阳市| 潞城市| 若羌县| 昌宁县| 南乐县| 鄂尔多斯市| 溆浦县| 思茅市| 郸城县| 民和| 南木林县| 射阳县| 隆昌县|