最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

使用Python爬取小姐姐圖片(beautifulsoup法)

 更新時(shí)間:2021年02月11日 08:10:03   作者:割韭菜的喵醬  
這篇文章主要介紹了Python爬取小姐姐圖片(beautifulsoup法),本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下

Python有許多強(qiáng)大的庫(kù)用于爬蟲(chóng),如beautifulsoup、requests等,本文將以網(wǎng)站https://www.xiurenji.cc/XiuRen/為例(慎點(diǎn)!?。v解網(wǎng)絡(luò)爬取圖片的一般步驟。
為什么選擇這個(gè)網(wǎng)站?其實(shí)與網(wǎng)站的內(nèi)容無(wú)關(guān)。主要有兩項(xiàng)技術(shù)層面的原因:①該網(wǎng)站的頁(yè)面構(gòu)造較有規(guī)律,適合新手對(duì)爬蟲(chóng)的技巧加強(qiáng)認(rèn)識(shí)。②該網(wǎng)站沒(méi)有反爬蟲(chóng)機(jī)制,可以放心使用爬蟲(chóng)。

第三方庫(kù)需求

  •  beautifulsoup
  • requests

 步驟

打開(kāi)網(wǎng)站,點(diǎn)擊不同的頁(yè)面:
發(fā)現(xiàn)其首頁(yè)是https://www.xiurenji.cc/XiuRen/,而第二頁(yè)是https://www.xiurenji.cc/XiuRen/index2.html,第三頁(yè)第四頁(yè)以此類推。為了爬蟲(chóng)代碼的普適性,我們不妨從第二頁(yè)以后進(jìn)行構(gòu)造url。

在這里插入圖片描述

選中封面圖片,點(diǎn)擊檢查:

在這里插入圖片描述

可以發(fā)現(xiàn),圖片的信息,都在'div',class_='dan'里,而鏈接又在a標(biāo)簽下的href里。據(jù)此我們可以寫(xiě)一段代碼提取出每一個(gè)封面圖片的url:

def getFirstPage(page):
  url='https://www.xiurenji.cc/XiuRen/index'+str(page)+'.html'#獲得網(wǎng)站每一個(gè)首頁(yè)的網(wǎng)址
  res=requests.get(url)#發(fā)送請(qǐng)求
  res.encoding="gbk"#設(shè)置編碼方式為gbk
  html=res.text
  soup=BeautifulSoup(html,features='lxml')
  lists=soup.find_all('div',class_='dan')#找到儲(chǔ)存每一個(gè)封面圖片的標(biāo)簽值
  urls=[]
  for item in lists:
   url1=item.find('a').get('href')#尋找每一個(gè)封面對(duì)應(yīng)的網(wǎng)址
   urls.append('https://www.xiurenji.cc'+url1)#在列表的尾部添加一個(gè)元素,達(dá)到擴(kuò)充列表的目的,注意要把網(wǎng)址擴(kuò)充完整
  return urls#返回該主頁(yè)每一個(gè)封面對(duì)應(yīng)的網(wǎng)址

點(diǎn)擊封面圖片,打開(kāi)不同的頁(yè)面,可以發(fā)現(xiàn),首頁(yè)的網(wǎng)址是https://www.xiurenji.cc/XiuRen/xxxx.html,而第二頁(yè)的網(wǎng)址是https://www.xiurenji.cc/XiuRen/xxxx_1.html,第三第四頁(yè)同理。同樣為了普適性,我們從第二頁(yè)開(kāi)始爬取。

在這里插入圖片描述

右鍵,點(diǎn)擊“檢查”:

在這里插入圖片描述

可以發(fā)現(xiàn)所有的圖片信息都儲(chǔ)存在'div',class_='img'中,鏈接、標(biāo)題分別在img標(biāo)簽中的srcalt中,我們同樣也可以將它們提取出來(lái)。

def getFirstPage(page):
  url='https://www.xiurenji.cc/XiuRen/index'+str(page)+'.html'#獲得網(wǎng)站每一個(gè)首頁(yè)的網(wǎng)址
  res=requests.get(url)#發(fā)送請(qǐng)求
  res.encoding="gbk"#設(shè)置編碼方式為gbk
  html=res.text
  soup=BeautifulSoup(html,features='lxml')
  lists=soup.find_all('div',class_='dan')#找到儲(chǔ)存每一個(gè)封面圖片的標(biāo)簽值
  urls=[]
  for item in lists:
   url1=item.find('a').get('href')#尋找每一個(gè)封面對(duì)應(yīng)的網(wǎng)址
   urls.append('https://www.xiurenji.cc'+url1)#在列表的尾部添加一個(gè)元素,達(dá)到擴(kuò)充列表的目的,注意要把網(wǎng)址擴(kuò)充完整
  return urls#返回該主頁(yè)每一個(gè)封面對(duì)應(yīng)的網(wǎng)址

完整代碼

import requests
from bs4 import BeautifulSoup

def getFirstPage(page):
  url='https://www.xiurenji.cc/XiuRen/index'+str(page)+'.html'#獲得網(wǎng)站每一個(gè)首頁(yè)的網(wǎng)址
  res=requests.get(url)#發(fā)送請(qǐng)求
  res.encoding="gbk"#設(shè)置編碼方式為gbk
  html=res.text
  soup=BeautifulSoup(html,features='lxml')
  lists=soup.find_all('div',class_='dan')#找到儲(chǔ)存每一個(gè)封面圖片的標(biāo)簽值
  urls=[]
  for item in lists:
   url1=item.find('a').get('href')#尋找每一個(gè)封面對(duì)應(yīng)的網(wǎng)址
   urls.append('https://www.xiurenji.cc'+url1)#在列表的尾部添加一個(gè)元素,達(dá)到擴(kuò)充列表的目的,注意要把網(wǎng)址擴(kuò)充完整
  return urls#返回該主頁(yè)每一個(gè)封面對(duì)應(yīng)的網(wǎng)址

def download(urls):
 for url1 in urls:
  print("prepare to download pictures in "+url1)
  getEveryPage(url1)#下載頁(yè)面內(nèi)的圖片
  print("all pictures in "+url1+"are downloaded")
  
def getEveryPage(url1):
 total=0#total的作用:對(duì)屬于每一個(gè)封面內(nèi)的圖片一次編號(hào)
 for n in range (1,11):#每一個(gè)封面對(duì)應(yīng)下載10張圖,可自行調(diào)整
  temp=url1.replace('.html','')
  url2=temp+'_'+str(n)+'.html'#獲得每一內(nèi)部頁(yè)面的網(wǎng)址
  res=requests.get(url2)
  res.encoding="gbk"
  html=res.text
  soup=BeautifulSoup(html,features='lxml')
  lists1=soup.find_all('div',class_='img')#儲(chǔ)存圖片的路徑
  
  for item in lists1:
   url=item.find('img').get('src')
   title=item.find('img').get('alt')#獲取圖片及其標(biāo)題
   picurl='https://www.xiurenji.cc'+url#獲取完整的圖片標(biāo)題
   picture=requests.get(picurl).content#下載圖片
   address='D:\pythonimages'+'\\'#自定義保存圖片的路徑
   with open(address+title+str(total)+'.jpg','wb') as file:#保存圖片
    print("downloading"+title+str(total))
    total=total+1
    file.write(picture)
    

if __name__ == "__main__":
 page=int(input('input the page you want:'))
 urls=getFirstPage(page)
 download(urls)

本文僅供學(xué)習(xí)參考,切勿用作其他用途!

到此這篇關(guān)于Python爬取小姐姐圖片(beautifulsoup法)的文章就介紹到這了,更多相關(guān)Python爬取小姐姐圖片內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • Python?NLP開(kāi)發(fā)之實(shí)現(xiàn)聊天機(jī)器人

    Python?NLP開(kāi)發(fā)之實(shí)現(xiàn)聊天機(jī)器人

    這篇文章主要為大家介紹了Python如何實(shí)現(xiàn)聊天機(jī)器人,即使用自然語(yǔ)言處理?(NLP)?來(lái)幫助用戶通過(guò)文本、圖形或語(yǔ)音與?Web?服務(wù)或應(yīng)用進(jìn)行交互,感興趣的可以了解一下
    2023-05-05
  • python實(shí)現(xiàn)簡(jiǎn)單石頭剪刀布游戲

    python實(shí)現(xiàn)簡(jiǎn)單石頭剪刀布游戲

    這篇文章主要介紹了python實(shí)現(xiàn)簡(jiǎn)單石頭剪刀布游戲,相信大家在童年或者生活中都玩過(guò)石頭剪刀布這個(gè)游戲,這個(gè)游戲需要兩個(gè)及以上的人。而今天,網(wǎng)上也實(shí)現(xiàn)了石頭剪刀布的游戲。通過(guò)初步學(xué)習(xí)python,也學(xué)會(huì)了如何編寫(xiě)這個(gè)游戲。下面一起來(lái)看看詳細(xì)內(nèi)容吧
    2021-10-10
  • TensorFlow神經(jīng)網(wǎng)絡(luò)創(chuàng)建多層感知機(jī)MNIST數(shù)據(jù)集

    TensorFlow神經(jīng)網(wǎng)絡(luò)創(chuàng)建多層感知機(jī)MNIST數(shù)據(jù)集

    這篇文章主要為大家介紹了TensorFlow神經(jīng)網(wǎng)絡(luò)如何創(chuàng)建多層感知機(jī)MNIST數(shù)據(jù)集的實(shí)現(xiàn)過(guò)程示例,有需要的朋友可以借鑒參考下,希望能夠有所幫助
    2021-11-11
  • python 截取 取出一部分的字符串方法

    python 截取 取出一部分的字符串方法

    下面小編就為大家?guī)?lái)一篇python 截取 取出一部分的字符串方法。小編覺(jué)得挺不錯(cuò)的,現(xiàn)在就分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧
    2017-03-03
  • python通過(guò)cython加密代碼

    python通過(guò)cython加密代碼

    這篇文章主要介紹了python通過(guò)cython實(shí)現(xiàn)加密的示例代碼,幫助大家加密自己的python代碼,提高安全性,感興趣的朋友可以參考下
    2020-12-12
  • python OpenCV學(xué)習(xí)筆記

    python OpenCV學(xué)習(xí)筆記

    這篇文章主要介紹了python OpenCV的相關(guān)資料,幫助大家更好的理解和學(xué)習(xí)使用python的opencv,感興趣的朋友可以了解下
    2021-03-03
  • Python入門(mén)教程2. 字符串基本操作【運(yùn)算、格式化輸出、常用函數(shù)】

    Python入門(mén)教程2. 字符串基本操作【運(yùn)算、格式化輸出、常用函數(shù)】

    這篇文章主要介紹了Python字符串基本操作,結(jié)合實(shí)例形式總結(jié)分析了Python字符串的基本表示、運(yùn)算、格式化輸出、常用函數(shù)等,注釋包含較為詳盡的說(shuō)明,便于理解,需要的朋友可以參考下
    2018-10-10
  • python 平衡二叉樹(shù)實(shí)現(xiàn)代碼示例

    python 平衡二叉樹(shù)實(shí)現(xiàn)代碼示例

    這篇文章主要介紹了python 平衡二叉樹(shù)實(shí)現(xiàn)代碼示例,小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧
    2018-07-07
  • 使用python matplotlib 畫(huà)圖導(dǎo)入到word中如何保證分辨率

    使用python matplotlib 畫(huà)圖導(dǎo)入到word中如何保證分辨率

    這篇文章主要介紹了使用python matplotlib 畫(huà)圖導(dǎo)入到word中如何保證分辨率的例子,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2020-04-04
  • Python SVM(支持向量機(jī))實(shí)現(xiàn)方法完整示例

    Python SVM(支持向量機(jī))實(shí)現(xiàn)方法完整示例

    這篇文章主要介紹了Python SVM(支持向量機(jī))實(shí)現(xiàn)方法,結(jié)合完整實(shí)例形式分析了基于Python實(shí)現(xiàn)向量機(jī)SVM算法的具體步驟與相關(guān)操作注意事項(xiàng),需要的朋友可以參考下
    2018-06-06

最新評(píng)論

新竹县| 湾仔区| 灵石县| 拉萨市| 建德市| 德惠市| 漠河县| 香港 | 南昌县| 佛坪县| 威远县| 八宿县| 叙永县| 东台市| 闽侯县| 霍州市| 汉阴县| 灵台县| 普安县| 宜兴市| 商南县| 宜丰县| 济阳县| 镇宁| 连城县| 西贡区| 万安县| 汉中市| 颍上县| 简阳市| 金平| 清镇市| 宝清县| 监利县| 萝北县| 灵川县| 彰武县| 许昌市| 绵竹市| 灵台县| 尉犁县|