最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python爬蟲常用的模塊分析

 更新時間:2014年08月29日 10:12:27   投稿:shichen2014  
這篇文章主要介紹了python爬蟲常用的模塊的creepy模塊,功能非常強大,文中較為詳細的講述了模塊接口的功能及用法,需要的朋友可以參考下

本文對Python爬蟲常用的模塊做了較為深入的分析,并以實例加以深入說明。分享給大家供大家參考之用。具體分析如下:

creepy模塊

某臺灣大神開發(fā)的,功能簡單,能夠自動抓取某個網(wǎng)站的所有內(nèi)容,當然你也可以設定哪些url需要抓。

地址:https://pypi.python.org/pypi/creepy

功能接口:

set_content_type_filter:
設定抓取的content-type(header中的contenttype)。包括text/html

add_url_filter:
過濾url,傳入的可以是正則表達式

set_follow_mode:
設定遞歸模式,F(xiàn)_ANY:該頁面上所有鏈接都會抓取。 F_SAME_DOMAIN和F_SAME_HOST類似。即同一個域名的都會抓取。F_SAME_PATH:同一路徑的抓取。例如bag.vancl.com/l1/d3/1.jpg path為l1/d3/1.jpg,則path為l1/d3/*的都會抓取。這里可以根據(jù)需要增加自己的遞歸模式

set_concurrency_level:
設定線程最大數(shù)

process_document:
一般需要重寫,處理網(wǎng)頁內(nèi)容,提取自己需要的內(nèi)容。

selenium
可視化界面,抓取自動化,api使用超簡單,完全像是自己在操作瀏覽器。

官方網(wǎng)站:http://www.seleniumhq.org/
python官方網(wǎng)站
http://pypi.python.org/pypi/selenium
webdriver api(很好用,建議多了解一下)
http://www.seleniumhq.org/docs/03_webdriver.jsp

以下是一個抓取凡客網(wǎng)站的例子:

from selenium import webdriver
from selenium.webdriver.common.keys import Keys
import time

browser = webdriver.Firefox()
browser.get('http://bag.vancl.com/28145-28167-a18568_18571-b1-n3-s1.html#ref=hp-hp-hot-8_1_1-v:n')
elem = browser.find_element_by_name('ch_bag-3-page-next') # Find the search box
time.sleep(1)
print elem.get_attribute("href")
elem.click()

time.sleep(1)
elem = browser.find_element_by_name('ch_bag-3-page-next') # Find the search box
print elem.get_attribute("href")
elem.click()

希望本文所述對大家的Python程序設計有所幫助。

相關文章

最新評論

霍山县| 大姚县| 竹北市| 海口市| 托克托县| 桐柏县| 水城县| 龙里县| 浦北县| 平凉市| 南开区| 攀枝花市| 天等县| 定陶县| 沛县| 河津市| 乌鲁木齐县| 利辛县| 达拉特旗| 石家庄市| 鄯善县| 固安县| 威信县| 平舆县| 深州市| 芒康县| 繁昌县| 中西区| 海盐县| 宾川县| 江源县| 万山特区| 敖汉旗| 邹城市| 白城市| 桑植县| 酉阳| 孟津县| 南江县| 南和县| 天长市|