最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python爬蟲獲取頁面所有URL鏈接過程詳解

 更新時間:2020年06月04日 15:00:01   作者:程序員的人生A  
這篇文章主要介紹了Python爬蟲獲取頁面所有URL鏈接過程詳解,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下

如何獲取一個頁面內(nèi)所有URL鏈接?在Python中可以使用urllib對網(wǎng)頁進(jìn)行爬取,然后利用Beautiful Soup對爬取的頁面進(jìn)行解析,提取出所有的URL。

什么是Beautiful Soup?

Beautiful Soup提供一些簡單的、python式的函數(shù)用來處理導(dǎo)航、搜索、修改分析樹等功能。它是一個工具箱,通過解析文檔為用戶提供需要抓取的數(shù)據(jù),因?yàn)楹唵危圆恍枰嗌俅a就可以寫出一個完整的應(yīng)用程序。

Beautiful Soup自動將輸入文檔轉(zhuǎn)換為Unicode編碼,輸出文檔轉(zhuǎn)換為utf-8編碼。你不需要考慮編碼方式,除非文檔沒有指定一個編碼方式,這時,Beautiful Soup就不能自動識別編碼方式了。

BeautifulSoup支持Python標(biāo)準(zhǔn)庫中的HTML解析器,還支持一些第三方的解析器,如果我們不安裝它,則 Python 會使用 Python默認(rèn)的解析器,lxml 解析器更加強(qiáng)大,速度更快。

全部代碼:

from bs4 import BeautifulSoup
import time,re,urllib2
t=time.time()
websiteurls={}
def scanpage(url):
 websiteurl=url
 t=time.time()
 n=0
 html=urllib2.urlopen(websiteurl).read()
 soup=BeautifulSoup(html)
 pageurls=[]
 Upageurls={}
 pageurls=soup.find_all("a",href=True)
 for links in pageurls:
  if websiteurl in links.get("href") and links.get("href") not in Upageurls and links.get("href") not in websiteurls:
   Upageurls[links.get("href")]=0
 for links in Upageurls.keys():
  try:
   urllib2.urlopen(links).getcode()
  except:
   print "connect failed"
  else:
   t2=time.time()
   Upageurls[links]=urllib2.urlopen(links).getcode()
   print n,
   print links,
   print Upageurls[links]
   t1=time.time()
   print t1-t2
  n+=1
 print ("total is "+repr(n)+" links")
 print time.time()-t
scanpage(http://news.163.com/)

利用BeautifulSoup還可以有針對性的獲取網(wǎng)頁鏈接:Python爬蟲獲取網(wǎng)頁上的鏈接,通過beautifulsoup的findall()方法對匹配的標(biāo)簽進(jìn)行查找。

以上就是本文的全部內(nèi)容,希望對大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

最新評論

珲春市| 老河口市| 高碑店市| 盐亭县| 香河县| 金湖县| 东乡县| 吴江市| 额济纳旗| 明光市| 黄浦区| 大同市| 萨嘎县| 嘉禾县| 平湖市| 平凉市| 郴州市| 黔南| 永胜县| 青阳县| 修文县| 莱州市| 西乌珠穆沁旗| 贡嘎县| 凤凰县| 汪清县| 施秉县| 门头沟区| 金阳县| 崇文区| 临颍县| 定日县| 长治县| 盱眙县| 桑植县| 龙陵县| 石柱| 拜泉县| 临澧县| 蒙自县| 微博|