最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python爬蟲爬取指定內(nèi)容的解決方法

 更新時間:2022年06月14日 09:03:16   作者:皓_月  
這篇文章主要介紹了python爬蟲爬取指定內(nèi)容,爬取一些網(wǎng)站下指定的內(nèi)容,一般來說可以用xpath來直接從網(wǎng)頁上來獲取,但是當(dāng)我們獲取的內(nèi)容不唯一的時候我們無法選擇,我們所需要的、所指定的內(nèi)容,需要的朋友可以參考下

爬取一些網(wǎng)站下指定的內(nèi)容,一般來說可以用xpath來直接從網(wǎng)頁上來獲取,但是當(dāng)我們獲取的內(nèi)容不唯一的時候我們無法選擇,我們所需要的、所指定的內(nèi)容。

解決辦法:

可以使用for In 語句來判斷
如果我們所指定的內(nèi)容在這段語句中我們就把這段內(nèi)容爬取下來,反之就丟棄

實列代碼如下:(以我們學(xué)校為例)

import urllib.request
from lxml import etree
def creat_url(page):
    if(page==1):
        url='https://www.qjnu.edu.cn/channels/9260.html'
    else:
        url='https://www.qjnu.edu.cn/channels/9260_'+str(page)+'.html'
    headers={
        'User-Agent':' Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.4951.64 Safari/537.36 Edg/101.0.1210.53'
    }
    request = urllib.request.Request(url=url,headers=headers)
    return request
def creat_respons(request):
    respons = urllib.request.urlopen(request)
    content = respons.read().decode('utf-8')
    return content
def down_2(url):
    url = url
    headers = {
        'User-Agent': ' Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/100.0.4896.60 Safari/537.36 Edg/100.0.1185.29'
    }
    request = urllib.request.Request(url=url, headers=headers)
    response = urllib.request.urlopen(request)
    content2 = response.read().decode('utf-8')
    tree2 = etree.HTML(content2)
    return tree2
def down_loads(content):
    tree = etree.HTML(content)
    name_list = tree.xpath('//div[@class="media"]/h4/a/text()')
    url_list = tree.xpath('//div[@class="media"]/h4/a/@href')
    for i in range(len(name_list)):
        if key in name_list[i]:
            with open('學(xué)校黨員主題網(wǎng)址.txt', 'a', encoding='UTF-8') as fp:
                fp.write(url_list[i]+'\n')
            url = url_list[i]
            tree = down_2(url)
            tex_list = tree.xpath('//div[@class="field-item even"]//p/span/text()')
            name = name_list[i]
            with open(name + '.txt', 'w', encoding='UTF-8') as fp:
                fp.write(str(tex_list))
if __name__ == '__main__':
    all_page=int(input('請輸入要爬取頁碼:'))
    key = str(input('請輸入關(guān)鍵詞:'))
    s_page=1
    for page in range(s_page,all_page+1):
        request=creat_url(page)
        content=creat_respons(request)
        down_loads(content)

此段代碼的可執(zhí)行性沒有問題,邏輯上也能夠串通
但是代碼冗余較多,看起來有點復(fù)雜,現(xiàn)在正在研究簡化版的代碼!

到此這篇關(guān)于python爬蟲爬取指定內(nèi)容的解決方法的文章就介紹到這了,更多相關(guān)python爬取指定內(nèi)容內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • django實現(xiàn)模型字段動態(tài)choice的操作

    django實現(xiàn)模型字段動態(tài)choice的操作

    這篇文章主要介紹了django實現(xiàn)模型字段動態(tài)choice的操作,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-04-04
  • python 匿名函數(shù)與三元運算學(xué)習(xí)筆記

    python 匿名函數(shù)與三元運算學(xué)習(xí)筆記

    這篇文章主要介紹了python 匿名函數(shù)與三元運算的相關(guān)資料,幫助大家更好的理解和學(xué)習(xí)python 編程,感興趣的朋友可以了解下
    2020-10-10
  • python scrapy框架中Request對象和Response對象的介紹

    python scrapy框架中Request對象和Response對象的介紹

    本文介紹了python基礎(chǔ)之scrapy框架中Request對象和Response對象的介紹,Request對象主要是用來請求數(shù)據(jù),爬取一頁的數(shù)據(jù)重新發(fā)送一個請求的時候調(diào)用,Response對象一般是由scrapy給你自動構(gòu)建的,因此開發(fā)者不需要關(guān)心如何創(chuàng)建Response對象,下面來一起來了解更多內(nèi)容吧
    2022-02-02
  • python實例化對象的具體方法

    python實例化對象的具體方法

    在本篇文章里小編給大家整理的是關(guān)于python實例化對象的具體方法,有興趣的朋友們可以學(xué)習(xí)下。
    2020-06-06
  • Python EOL while scanning string literal問題解決方法

    Python EOL while scanning string literal問題解決方法

    這篇文章主要介紹了Python EOL while scanning string literal問題解決方法,本文總結(jié)出是數(shù)據(jù)庫數(shù)據(jù)出現(xiàn)問題導(dǎo)致這個問題,需要的朋友可以參考下
    2015-04-04
  • python3.4控制用戶輸入與輸出的方法

    python3.4控制用戶輸入與輸出的方法

    今天小編就為大家分享一篇python3.4控制用戶輸入與輸出的方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-10-10
  • Python網(wǎng)絡(luò)編程中urllib2模塊的用法總結(jié)

    Python網(wǎng)絡(luò)編程中urllib2模塊的用法總結(jié)

    使用urllib2模塊進行基于url的HTTP請求等操作大家也許都比較熟悉,這里我們再深入來了解一下urllib2針對HTTP的異常處理相關(guān)功能,一起來看一下Python網(wǎng)絡(luò)編程中urllib2模塊的用法總結(jié):
    2016-07-07
  • python批量將excel內(nèi)容進行翻譯寫入功能

    python批量將excel內(nèi)容進行翻譯寫入功能

    這篇文章主要介紹了python批量將excel內(nèi)容進行翻譯寫入功能,本文通過實例代碼給大家介紹的非常詳細(xì),具有一定的參考借鑒價值,需要的朋友可以參考下
    2019-10-10
  • Python四大金剛之字典詳解

    Python四大金剛之字典詳解

    這篇文章主要介紹了Python的字典,小編覺得這篇文章寫的還不錯,需要的朋友可以參考下,希望能夠給你帶來幫助
    2021-10-10
  • Python中matplotlib如何改變畫圖的字體

    Python中matplotlib如何改變畫圖的字體

    這篇文章主要介紹了Python中matplotlib如何改變畫圖的字體,本文給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2021-08-08

最新評論

繁峙县| 镇坪县| 赣州市| 玉龙| 江山市| 周宁县| 木兰县| 富裕县| 玛多县| 白银市| 宝坻区| 遵义市| 伽师县| 大悟县| 乌什县| 宜都市| 庄浪县| 富蕴县| 桃江县| 砀山县| 蕉岭县| 八宿县| 迭部县| 玉田县| 壶关县| 平湖市| 哈尔滨市| 大方县| 中西区| 三河市| 宁晋县| 广平县| 涪陵区| 元阳县| 沂水县| 美姑县| 河南省| 阿拉尔市| 新营市| 五家渠市| 科尔|