最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python使用Beautiful Soup爬取豆瓣音樂排行榜過程解析

 更新時間:2019年08月15日 12:00:33   作者:Summer哥  
這篇文章主要介紹了Python使用Beautiful Soup爬取網(wǎng)頁過程解析,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下

前言

要想學(xué)好爬蟲,必須把基礎(chǔ)打扎實(shí),之前發(fā)布了兩篇文章,分別是使用XPATH和requests爬取網(wǎng)頁,今天的文章是學(xué)習(xí)Beautiful Soup并通過一個例子來實(shí)現(xiàn)如何使用Beautiful Soup爬取網(wǎng)頁。

什么是Beautiful Soup

  • Beautiful Soup是一款高效的Python網(wǎng)頁解析分析工具,可以用于解析HTL和XML文件并從中提取數(shù)據(jù)。
  • Beautiful Soup輸入文件的默認(rèn)編碼是Unicode,輸出文件的編碼是UTF-8。
  • Beautiful Soup具有將輸入文件自動補(bǔ)全的功能,如果輸入的HTML文件的title標(biāo)簽沒有閉合,則在輸出的文件中會自動補(bǔ)全</title>,并且還可以將格式混亂的輸入文件按照標(biāo)準(zhǔn)的縮進(jìn)格式輸出。

Beautiful Soup要和其他的解析器搭配使用,例如Python標(biāo)準(zhǔn)庫中的HTML解析器和其他第三方的lxml解析器,由于lxml解析器速度快、容錯能力強(qiáng),因此一般和Beautiful Soup搭配使用。

初始化Beautiful Soup對象的代碼:

html = 
'''
<html><title>Hello Beautiful Soup</title><p>Hello</p></html>
'''
soup = BeautifulSoup(html,'lxml')

只需把第二個參數(shù)寫成”lxml”即可使用lxml解析器初始化Beautiful Soup對象。

Beautiful Soup提供了三種選擇器用去爬取節(jié)點(diǎn)中的數(shù)據(jù),分別是節(jié)點(diǎn)選擇器、方法選擇器和CSS選擇器。下面分別介紹著三個選擇器的用法。

節(jié)點(diǎn)選擇器:

HTML網(wǎng)頁有title、p、a、head、tr、td等節(jié)點(diǎn)。通過Beautiful Soup對象+”.”+節(jié)點(diǎn)即可直接訪問到節(jié)點(diǎn)。 Beautiful Soup對象+”.”+節(jié)點(diǎn)+”.”+string即可提取到節(jié)點(diǎn)的文本信息。

用法 描述
soup.title 選擇第一個title節(jié)點(diǎn)
soup.title.string 提取第一個title節(jié)點(diǎn)的文本信息
soup.title.attrs 獲取第一個title節(jié)點(diǎn)的所有屬性,返回的結(jié)果的詞典。
如果有class屬性,則class屬性返回的是list,class屬性之間以空格當(dāng)做分隔符
soup.p.contents 獲取第一個p節(jié)點(diǎn)的所有直接子節(jié)點(diǎn)。
該方法返回的是第一個p節(jié)點(diǎn)中包含的所有直接子字節(jié)點(diǎn)和文本,
不包含孫節(jié)點(diǎn),兩個節(jié)點(diǎn)之間的文本也當(dāng)做是一個節(jié)點(diǎn)返回。
返回的結(jié)果是列表
soup.p.children 返回第一個p節(jié)點(diǎn)的所有直接子節(jié)點(diǎn),返回的結(jié)果是list_iterator對象
soup.p.descendants 獲取第一個p節(jié)點(diǎn)的所有子孫節(jié)點(diǎn)
soup.a.parent 獲取第一個a節(jié)點(diǎn)的父節(jié)點(diǎn)
soup.a.parents 獲取第一個a節(jié)點(diǎn)的所有祖先節(jié)點(diǎn)
soup.p.next_siblings 獲取第一個p節(jié)點(diǎn)的下一個兄弟節(jié)點(diǎn)
soup.p.previous_siblings 獲取第一個p節(jié)點(diǎn)的上一個兄弟節(jié)點(diǎn)

方法選擇器:

根據(jù)傳入的參數(shù)查找符合條件的節(jié)點(diǎn)。 下面是方法選擇器提供的方法:

方法 描述
find_all(name,attrs,recursive,text,**kwargs) 根據(jù)傳入?yún)?shù)查找所有符合條件的節(jié)點(diǎn),
name是節(jié)點(diǎn)名,attrs屬性值,text文本內(nèi)容等。
text參數(shù)可以是字符串,也可以是正則表達(dá)式:
soup.find_all(text=re.compile(‘test'))
find(name,attrs,recursive,text,**kwargs) 返回第一個符合條件的節(jié)點(diǎn)
find_parents() 返回所有祖先節(jié)點(diǎn)
find_parent() 返回父節(jié)點(diǎn)
find_next_siblings() 往后查找,所有兄弟節(jié)點(diǎn)
find_next_sibling() 往后查找,返回第一個兄弟節(jié)點(diǎn)
find_previous_siblings() 往前查找,返回所有兄弟節(jié)點(diǎn)
find_previous_sibling() 往前查找,返回第一個兄弟節(jié)點(diǎn)

在使用上面的方法時,如果參數(shù)中有Python的關(guān)鍵字,則需要在參數(shù)下面加一個下劃線,例如下面的代碼,class是Python的關(guān)鍵字,必須在class后加下劃線class_=”title_class”:

from bs4 import BeautifulSoup
html = '''
<html>
  <body>
    <title id="title_id" class="title_class" name="title name">Test BeautifulSoup</title>
    <p>
      <a href = "./test_beautifulsoup.html">test beautifulsoup link<a>
      
    </p>
    <ul>
      <li class="animal">cat</li>
      <li class="animal">dog</li>
    </ul>
  </body>
</html>
'''
soup = BeautifulSoup(html,'lxml')
print(soup.find_all(name='title',class_='title_class'))

CSS選擇器:

BeautifulSoup還支持獲取css元素,例如ul、div、li等元素。CSS選擇器主要提供select()方法獲取符合條件的節(jié)點(diǎn)(Tag對象),然后通過節(jié)點(diǎn)的get_text()方法和text屬性可以獲取該節(jié)點(diǎn)的文本值。

select方法還可以根據(jù)css的樣式規(guī)則選擇相應(yīng)的節(jié)點(diǎn):

from bs4 import BeautifulSoup

html = '''
<html>
  <body>
    <title id="title_id" class="title_class" name="title name">Test BeautifulSoup</title>
    <p>
      <a href = "./test_beautifulsoup.html">test beautifulsoup link<a>
      
    </p>
    <ul class="animal" id="aninal_id">
      <li class="cat">cat</li>
      <li class="animal dog">dog</li>
    </ul>
    <ul class="fruit" id = "fruit_id">
      <li class="apple">apple</li>
      <li class="banana">banana</li>
    </ul>
  </body>
</html>
'''
soup = BeautifulSoup(html,'lxml')
print('獲取id為title_的所有節(jié)點(diǎn)')
print(soup.select('#title_id'))
print('獲取class為title_的所有節(jié)點(diǎn)')
print(soup.select('.title_class'))
print('獲取所有ul節(jié)點(diǎn)下面的所有l(wèi)i節(jié)點(diǎn)')
print(soup.select('ul li'))
print('獲取所有class為fruit節(jié)點(diǎn)下的所有l(wèi)i節(jié)點(diǎn)')
print(soup.select('.fruit li'))
print('獲取所有class為fruit節(jié)點(diǎn)下的第一個li節(jié)點(diǎn)的文本值')
print(soup.select('.fruit li')[0].string)
print('獲取所有class為fruit節(jié)點(diǎn)下的第一個li節(jié)點(diǎn)的文本值')
print(soup.select('.fruit li')[0].get_text())
print('獲取所有class為fruit節(jié)點(diǎn)下的第一個li節(jié)點(diǎn)的class屬性值,注意class屬性返回的是list列表,屬性之間用空格分隔')
print(soup.select('.fruit li')[0].attrs['class'])
print(soup.select('.animal li')[1].attrs['class'])
print('循環(huán)迭代所有ul下面的所有l(wèi)i節(jié)點(diǎn)的文本值')
for li in soup.select('ul li'):
  print(li.text)

下面使用Beautiful Soup爬取豆瓣音樂排行榜。 在瀏覽器中打開豆瓣音樂排行榜,打開瀏覽器,輸入網(wǎng)址:https://music.douban.com/chart,我們要抓取的是每首歌曲的排名、歌曲名、演唱者、播放次數(shù)、上榜天數(shù)等數(shù)據(jù)。

下面分析怎么通過beautiful soup抓取到我們的數(shù)據(jù)。 通過開發(fā)者工具,我們可以看到所有歌曲是在class為article的div中,然后每首個在class為clearfix的li中。


因此首先使用css選擇器獲取到class為article下面的所有l(wèi)i節(jié)點(diǎn):

soup.select(".article li")

然后查看每首歌曲的html代碼:


紅色框部分是一首歌的html代碼。 歌曲排名在class為“gree-num-box”的span節(jié)點(diǎn)中,因?yàn)閟pan節(jié)點(diǎn)是<li class="clearfix">節(jié)點(diǎn)的子節(jié)點(diǎn),獲取排名的代碼為:li.span.text

綠色框中A節(jié)點(diǎn)中是歌曲的鏈接和圖片鏈接,獲取歌曲鏈接的代碼為:li.a['href']

藍(lán)色框中是歌曲的名字、演唱者和播放次數(shù),歌曲名是在class=”icon-play”的H3節(jié)點(diǎn)中,因此可以使用方法選擇器中的find()方法獲取到H3節(jié)點(diǎn),然后獲取H3節(jié)點(diǎn)下面a節(jié)點(diǎn)中的文本信息就是歌曲的名字,代碼為:li.find(class_="icon-play").a.text

獲取演唱者和播放次數(shù)的代碼為: li.find(class_="intro").p.text.strip()

獲取上榜天數(shù)的代碼為:

li.find(class_="days").text.strip()

在豆瓣音樂排行榜的頁面一個現(xiàn)實(shí)20首歌曲,前面10首歌曲會有圖片,后面10首歌曲是沒有圖片的,因此后面10首歌曲將不獲取圖片的地址。

另外還有一點(diǎn)需要注意的是,后面10首歌曲的演唱者和播放次數(shù)是在class=”icon-play”的p節(jié)點(diǎn)中:

而該節(jié)點(diǎn)中有a節(jié)點(diǎn),要想獲取a節(jié)點(diǎn)外的信息,必須使用節(jié)點(diǎn)選擇器的contents方法: li.find(class_="intro").p.contents[2].strip() contents返回的是p節(jié)點(diǎn)的直接子節(jié)點(diǎn),以列表的形式返回,這里返回列表中有3個元素,分別是<p>后的字符串,a節(jié)點(diǎn)、演唱者/播次數(shù)。contents會將直接子節(jié)點(diǎn)之間的換行符也當(dāng)做一個元素。 代碼整理后如下:

# coding:utf-8

from bs4 import BeautifulSoup
import requests
def parseHtml(url):
  headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36 SE 2.X MetaSr 1.0"}

  response = requests.get(url,headers=headers)
  soup = BeautifulSoup(response.text,'lxml')
  #使用css選擇器獲取class="article"的節(jié)點(diǎn)下面的所有l(wèi)i節(jié)點(diǎn)
  for index,li in enumerate(soup.select(".article li")):
    if(index <10):
      print('歌曲排名:' + li.span.text)
      print('歌曲鏈接:' + li.a['href'])
      print('歌曲名:' + li.find(class_="icon-play").a.text)#使用方法選擇器
      print('演唱者/播放次數(shù):' + li.find(class_="intro").p.text.strip())
      print('上榜時間:'+li.find(class_="days").text.strip())
    else:
      print('歌曲排名:' + li.span.text)
      print('歌曲名:' + li.find(class_="icon-play").a.text)
      print('演唱者/播放次數(shù):' + li.find(class_="intro").p.contents[2].strip())#方法選擇器和節(jié)點(diǎn)選擇器搭配使用
      print('上榜時間:' + li.find(class_="days").text.strip())
    print('—————————————————強(qiáng)力分隔符———————————————————')

def main():
  url = "https://music.douban.com/chart"
  parseHtml(url)

if __name__ == '__main__':
  main()

本文通過爬取豆瓣音樂排行榜的小項(xiàng)目學(xué)習(xí)了如何使用Beautiful Soup的節(jié)點(diǎn)選擇器、方法選擇器、CSS選擇器來爬取一個網(wǎng)頁。這三個選擇器可以混合搭配使用。

以上就是本文的全部內(nèi)容,希望對大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

  • Python函數(shù)裝飾器的使用教程

    Python函數(shù)裝飾器的使用教程

    在了解了Python函數(shù)裝飾器基礎(chǔ)知識和閉包之后,開始正式學(xué)習(xí)函數(shù)裝飾器。感興趣的朋友可以參考本文
    2021-06-06
  • Python PyQt5模塊實(shí)現(xiàn)窗口GUI界面代碼實(shí)例

    Python PyQt5模塊實(shí)現(xiàn)窗口GUI界面代碼實(shí)例

    這篇文章主要介紹了Python PyQt5模塊實(shí)現(xiàn)窗口GUI界面代碼實(shí)例,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下
    2020-05-05
  • Python數(shù)據(jù)結(jié)構(gòu)之列表與元組詳解

    Python數(shù)據(jù)結(jié)構(gòu)之列表與元組詳解

    序列是Python中最基本的數(shù)據(jù)結(jié)構(gòu)。序列中的每個元素都分配一個數(shù)字 - 它的位置,或索引,第一個索引是0,第二個索引是1,依此類推,元組與列表類似,不同之處在于元組的元素不能修改。元組使用小括號,列表使用方括號
    2021-10-10
  • python使用xlrd模塊讀取xlsx文件中的ip方法

    python使用xlrd模塊讀取xlsx文件中的ip方法

    今天小編就為大家分享一篇python使用xlrd模塊讀取xlsx文件中的ip方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-01-01
  • python解釋器pycharm安裝及環(huán)境變量配置教程圖文詳解

    python解釋器pycharm安裝及環(huán)境變量配置教程圖文詳解

    這篇文章主要介紹了python解釋器pycharm安裝及環(huán)境變量配置教程圖文詳解,本文圖文并茂給大家介紹的非常詳細(xì),具有一定的參考借鑒價值,需要的朋友可以參考下
    2020-02-02
  • python實(shí)現(xiàn)楊氏矩陣查找

    python實(shí)現(xiàn)楊氏矩陣查找

    這篇文章主要為大家詳細(xì)介紹了Python實(shí)現(xiàn)楊氏矩陣查找,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2019-03-03
  • numpy中數(shù)組的堆疊方法

    numpy中數(shù)組的堆疊方法

    本文主要介紹了numpy中數(shù)組的堆疊方法,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2023-02-02
  • Python 的 f-string 可以連接字符串與數(shù)字的原因解析

    Python 的 f-string 可以連接字符串與數(shù)字的原因解析

    這篇文章主要介紹了Python 的 f-string 可以連接字符串與數(shù)字的原因解析,本文給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2021-02-02
  • scikit-learn線性回歸,多元回歸,多項(xiàng)式回歸的實(shí)現(xiàn)

    scikit-learn線性回歸,多元回歸,多項(xiàng)式回歸的實(shí)現(xiàn)

    這篇文章主要介紹了scikit-learn線性回歸,多元回歸,多項(xiàng)式回歸的實(shí)現(xiàn),文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2019-08-08
  • PyTorch預(yù)訓(xùn)練的實(shí)現(xiàn)

    PyTorch預(yù)訓(xùn)練的實(shí)現(xiàn)

    這篇文章主要介紹了PyTorch預(yù)訓(xùn)練的實(shí)現(xiàn),文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2019-09-09

最新評論

灵寿县| 秦安县| 张家界市| 寿宁县| 华蓥市| 华宁县| 根河市| 兴化市| 石首市| 屏山县| 丹东市| 衡南县| 眉山市| 广昌县| 武穴市| 凤山市| 西吉县| 当雄县| 萍乡市| 晋江市| 淮北市| 临潭县| 富民县| 文成县| 和静县| 凭祥市| 克东县| 紫云| 云梦县| 井陉县| 稻城县| 曲麻莱县| 盈江县| 蒲江县| 长治市| 新野县| 泽州县| 平乡县| 进贤县| 扬州市| 长岛县|