最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python?文檔解析lxml庫(kù)的使用詳解

 更新時(shí)間:2022年09月09日 08:46:33   作者:小嗷犬  
lxml 是 Python 常用的文檔解析庫(kù),能夠高效地解析 HTML/XML 文檔,常用于 Python 爬蟲(chóng),這篇文章主要介紹了Python?文檔解析:lxml庫(kù)的使用,需要的朋友可以參考下

1.lxml庫(kù)簡(jiǎn)介

lxml 是 Python 常用的文檔解析庫(kù),能夠高效地解析 HTML/XML 文檔,常用于 Python 爬蟲(chóng)。

lxml 為第三方庫(kù),需要我們通過(guò)pip命令安裝:

pip install lxml

2.lxml庫(kù)方法介紹

lxml 庫(kù)提供了一個(gè) etree 模塊,該模塊專(zhuān)門(mén)用來(lái)解析 HTML/XML 文檔,讓我們先導(dǎo)入模塊:

from lxml import etree

使用 etree 模塊的 HTML() 方法可以創(chuàng)建 HTML 解析對(duì)象:

from lxml import etree
parse_html = etree.HTML(html)

HTML() 方法能夠?qū)?HTML 標(biāo)簽字符串解析為 HTML 文件,并且可以自動(dòng)修正 HTML 文本:

from lxml import etree
html_str = '''
<div>
    <ul>
        <li><a href="www.python.org">Python</a></li>
        <li><a href="www.java.com">Java</a>
        <li><a href="www.csdn.net">CSDN</a></li>
    </ul>
</div>
'''

html = etree.HTML(html_str)
# tostring()將標(biāo)簽元素轉(zhuǎn)換為字符串輸出,注意:result為字節(jié)類(lèi)型
result = etree.tostring(html)
print(result.decode('utf-8'))

上述代碼我故意在Java那一行少寫(xiě)一個(gè)</li>,可以看到輸出會(huì)自動(dòng)補(bǔ)全:

<html><body><div>
    <ul>
        <li><a href="www.python.org">Python</a></li>
        <li><a href="www.java.com">Java</a></li>
        <li><a href="www.csdn.net">CSDN</a></li>
    </ul>
</div>
</body></html>

解析為 HTML 文件后,我們可以使用 xpath() 方法來(lái)提取我們需要的數(shù)據(jù)了:

from lxml import etree

html_str = '''
<div>
    <ul>
        <li><a href="www.python.org">Python</a></li>
        <li><a href="www.java.com">Java</a></li>
        <li><a href="www.csdn.net">CSDN</a></li>
    </ul>
</div>
'''

html=etree.HTML(html_str)

xpath_bds='//@href'

r_list = html.xpath(xpath_bds)

print(r_list)

xpath() 方法使用一個(gè) XPath 表達(dá)式作為參數(shù),上面那段程序提取出了頁(yè)面里的所有網(wǎng)址。

詳細(xì)的 XPath 表達(dá)式語(yǔ)法,請(qǐng)參見(jiàn)菜鳥(niǎo)教程:
https://www.runoob.com/xpath/xpath-syntax.html

3.代碼實(shí)例

lxml 庫(kù)在爬蟲(chóng)中的使用大概就是這么多了,接下讓我們結(jié)合前一篇文章(Python 網(wǎng)頁(yè)請(qǐng)求:requests庫(kù)的使用),來(lái)寫(xiě)一個(gè)普通的爬蟲(chóng)程序吧:

import os
import sys
import requests
from lxml import etree

x = requests.get('https://www.csdn.net/')


html = etree.HTML(x.text)

xpath_bds = '//img/@src'

img_list = html.xpath(xpath_bds)

# 創(chuàng)建img文件夾
os.chdir(os.path.dirname(sys.argv[0]))

if not os.path.exists('img'):
    os.mkdir('img')
    print('創(chuàng)建文件夾成功')
else:
    print('文件夾已存在')

# 下載圖片
for i in range(len(img_list)):
    img = requests.get(img_list[i]).content
    if img_list[i].endswith('.jpg'):
        with open(f'./img/{i}.jpg', 'wb') as f:
            f.write(img)
    elif img_list[i].endswith('.jpeg'):
        with open(f'./img/{i}.jpeg', 'wb') as f:
            f.write(img)
    elif img_list[i].endswith('.png'):
        with open(f'./img/{i}.png', 'wb') as f:
            f.write(img)
    else:
        print(f'第{i + 1}張圖片格式不正確')
        continue
    print(f'第{i + 1}張圖片下載成功')

這個(gè)爬蟲(chóng)程序爬取了CSDN首頁(yè)的所有.jpg.jpeg、.png格式的圖片,快來(lái)自己嘗試一下吧!

到此這篇關(guān)于Python 文檔解析lxml庫(kù)的使用的文章就介紹到這了,更多相關(guān)Python lxml庫(kù)內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • 使用Python進(jìn)行穩(wěn)定可靠的文件操作詳解

    使用Python進(jìn)行穩(wěn)定可靠的文件操作詳解

    在本文中,主要分享一些如何在Python代碼中改善I/O可靠性的見(jiàn)解,大家參考使用吧
    2013-12-12
  • 詳解python opencv、scikit-image和PIL圖像處理庫(kù)比較

    詳解python opencv、scikit-image和PIL圖像處理庫(kù)比較

    這篇文章主要介紹了詳解python opencv、scikit-image和PIL圖像處理庫(kù)比較,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2019-12-12
  • Python調(diào)用Zoomeye搜索接口的實(shí)現(xiàn)

    Python調(diào)用Zoomeye搜索接口的實(shí)現(xiàn)

    本文主要介紹了Python調(diào)用Zoomeye搜索接口的實(shí)現(xiàn),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2023-01-01
  • centos 安裝Python3 及對(duì)應(yīng)的pip教程詳解

    centos 安裝Python3 及對(duì)應(yīng)的pip教程詳解

    這篇文章主要介紹了centos 安裝Python3 及對(duì)應(yīng)的pip的教程,本文給大家介紹的非常詳細(xì),具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2019-06-06
  • Python isinstance函數(shù)介紹

    Python isinstance函數(shù)介紹

    這篇文章主要介紹了Python isinstance函數(shù)介紹,本文用實(shí)例講解了判斷變量是否是某個(gè)指定類(lèi)型,需要的朋友可以參考下
    2015-04-04
  • python通過(guò)文本在一個(gè)圖中畫(huà)多條線的實(shí)例

    python通過(guò)文本在一個(gè)圖中畫(huà)多條線的實(shí)例

    今天小編就為大家分享一篇python通過(guò)文本在一個(gè)圖中畫(huà)多條線的實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2020-02-02
  • python文件讀寫(xiě)操作小結(jié)

    python文件讀寫(xiě)操作小結(jié)

    python文件對(duì)象提供了三個(gè)“讀”方法:?read()、readline()?和?readlines(),每種方法可以接受一個(gè)變量以限制每次讀取的數(shù)據(jù)量,這篇文章主要介紹了python文件讀寫(xiě)小結(jié),需要的朋友可以參考下
    2022-02-02
  • Python中使用matplotlib模塊errorbar函數(shù)繪制誤差棒圖實(shí)例代碼

    Python中使用matplotlib模塊errorbar函數(shù)繪制誤差棒圖實(shí)例代碼

    在matplotlib中,errorbar方法用于繪制帶誤差線的折線圖,下面這篇文章主要給大家介紹了關(guān)于Python中使用matplotlib模塊errorbar函數(shù)繪制誤差棒圖的相關(guān)資料,需要的朋友可以參考下
    2022-08-08
  • python 編碼中為什么要寫(xiě)類(lèi)型注解?

    python 編碼中為什么要寫(xiě)類(lèi)型注解?

    這篇文章主要介紹了python 編碼中為什么要寫(xiě)類(lèi)型注解,幫助大家更好的理解和學(xué)習(xí)使用python,感興趣的朋友可以了解下
    2021-03-03
  • Python?切片為什么不會(huì)索引越界?

    Python?切片為什么不會(huì)索引越界?

    這篇文章主要介紹了Python?切片為什么不會(huì)索引越界?切片(slice)是?Python?中一種很有特色的特性,在正式開(kāi)始之前,我們先來(lái)從關(guān)于切片的相關(guān)知識(shí)開(kāi)始介紹,感興趣的小伙伴一起參考參考呀</P><P>
    2021-12-12

最新評(píng)論

松溪县| 民权县| 繁昌县| 宿迁市| 马公市| 普陀区| 衡东县| 库尔勒市| 淳化县| 宁津县| 屏山县| 新野县| 边坝县| 若尔盖县| 绥化市| 磐石市| 泾川县| 双柏县| 黔西县| 武宣县| 博罗县| 洪湖市| 竹溪县| 集安市| 米脂县| 彝良县| 八宿县| 上蔡县| 新巴尔虎右旗| 临夏县| 邵阳市| 德惠市| 天柱县| 丹江口市| 泗阳县| 崇阳县| 兴化市| 图木舒克市| 南漳县| 西贡区| 合山市|