最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python爬蟲之自動(dòng)爬取某車之家各車銷售數(shù)據(jù)

 更新時(shí)間:2021年06月02日 16:39:16   作者:程序員啟航  
應(yīng)朋友要求,幫忙采集某車之家的一些汽車品牌的銷售數(shù)據(jù),包含購(gòu)車時(shí)間、車型、經(jīng)銷商、裸車價(jià)等一類信息. 今天我們就簡(jiǎn)單演示一下采集過(guò)程,大家可以根據(jù)自己的興趣進(jìn)行拓展.比如采集自己喜歡的品牌汽車數(shù)據(jù)進(jìn)行統(tǒng)計(jì)分析等等,需要的朋友可以參考下

一、目標(biāo)網(wǎng)頁(yè)分析

目標(biāo)網(wǎng)站是某車之家關(guān)于品牌汽車車型的口碑模塊相關(guān)數(shù)據(jù),比如我們演示的案例奧迪Q5L的口碑頁(yè)面如下:

https://k.autohome.com.cn/4851/#pvareaid=3311678

為了演示方式,大家可以直接打開上面這個(gè)網(wǎng)址,然后拖到全部口碑位置,找到我們本次采集需要的字段如下圖所示:

Image

采集字段

我們進(jìn)行翻頁(yè)發(fā)現(xiàn),瀏覽器網(wǎng)址發(fā)生了變化,大家可以對(duì)下如下幾頁(yè)的網(wǎng)址找出規(guī)律:

https://k.autohome.com.cn/4851/index_2.html#dataList
https://k.autohome.com.cn/4851/index_3.html#dataList
https://k.autohome.com.cn/4851/index_4.html#dataList

對(duì)于上面寫網(wǎng)址,我們發(fā)現(xiàn)可變部分是車型(如4851)以及頁(yè)碼(如2,3,4),于是我們可以構(gòu)建url參數(shù)如下:

# typeid是車型,page是頁(yè)碼
url = f'https://k.autohome.com.cn/{typeid}/index_{page}.html#dataList'

二、數(shù)據(jù)請(qǐng)求

通過(guò)簡(jiǎn)單的測(cè)試,發(fā)現(xiàn)似乎不存在反爬,那就簡(jiǎn)單了。

我們先引入需要用到的庫(kù):

import requests
import pandas as pd
import html
from lxml import etree
import re

然后創(chuàng)建一個(gè)數(shù)據(jù)請(qǐng)求的函數(shù)備用:

# 獲取網(wǎng)頁(yè)數(shù)據(jù)(傳遞參數(shù) 車型typeid和頁(yè)碼數(shù))
def get_html(typeid,page):
    # 組合出請(qǐng)求地址
    url = f'https://k.autohome.com.cn/{typeid}/index_{page}.html#dataList'
    # 請(qǐng)求數(shù)據(jù)(因?yàn)闆](méi)有反爬,這里沒(méi)有設(shè)置請(qǐng)求頭和其他參數(shù))
    r = requests.get(url)
    # 請(qǐng)求的網(wǎng)頁(yè)數(shù)據(jù)中有網(wǎng)頁(yè)特殊字符,通過(guò)以下方法進(jìn)行解析
    r = html.unescape(r.text)
    # 返回網(wǎng)頁(yè)數(shù)據(jù)
    return r

請(qǐng)求來(lái)的數(shù)據(jù)就是網(wǎng)頁(yè)html文本,我們接下來(lái)采用re解析出一共多少頁(yè)碼,再用xpath進(jìn)行采集字段的解析。

三、數(shù)據(jù)解析

由于需要進(jìn)行翻頁(yè),這里我們可以先通過(guò)re正則表達(dá)式獲取總頁(yè)碼。通過(guò)查看網(wǎng)頁(yè)數(shù)據(jù),我們發(fā)現(xiàn)總頁(yè)碼可以通過(guò)如下方式獲取:

try:
    pages = int(re.findall(r'共(\d+)頁(yè)',r)[0])
# 如果請(qǐng)求不到頁(yè)數(shù),則表示該車型下沒(méi)有口碑?dāng)?shù)據(jù)
except :
    print(f'{name} 沒(méi)有數(shù)據(jù)!')
    continue

Image

總頁(yè)碼采集

關(guān)于待采集字段信息,我們發(fā)現(xiàn)都在節(jié)點(diǎn)div[@class="mouthcon-cont-left"]里,可以先定位這個(gè)節(jié)點(diǎn)數(shù)據(jù),然后再進(jìn)行逐一解析。

Image

待采集字段信息所在節(jié)點(diǎn)

此外,我們發(fā)現(xiàn)每一頁(yè)最多15個(gè)車型口碑?dāng)?shù)據(jù),因此我們每頁(yè)可以定位15個(gè)待采集信息數(shù)據(jù)集,遍歷采集代碼:

divs = r_html.xpath('.//div[@class="mouthcon-cont-left"]')
# 遍歷每個(gè)全部的車輛銷售信息
for div in divs:
    # 找到車輛銷售信息所在的地方
    mt = div.xpath('./div[@class="choose-con mt-10"]')[0]
    # 找到所需字段
    infos = mt.xpath('./dl[@class="choose-dl"]')
    # 設(shè)置空的字典,用于存儲(chǔ)單個(gè)車輛信息
    item = {}
    # 遍歷車輛信息字段
    for info in infos:
        key = info.xpath('.//dt/text()')[0]
        # 當(dāng)字段為購(gòu)買車型時(shí),進(jìn)行拆分為車型和配置
        if key == '購(gòu)買車型':
            item[key] = info.xpath('.//dd/a/text()')[0]
            item['購(gòu)買配置'] = info.xpath('.//span[@class="font-arial"]/text()')[0]
        # 當(dāng)字段為購(gòu)車經(jīng)銷商時(shí),需要獲取經(jīng)銷商的id參數(shù),再調(diào)用api獲取其真實(shí)經(jīng)銷商信息(這里有坑)
        elif key == '購(gòu)車經(jīng)銷商':
            # 經(jīng)銷商id參數(shù)
            經(jīng)銷商id = info.xpath('.//dd/a/@data-val')[0] +','+ info.xpath('.//dd/a/@data-evalid')[0]
            # 組合經(jīng)銷商信息請(qǐng)求地址
            jxs_url = base_jxs_url+經(jīng)銷商id+'|'
            # 請(qǐng)求數(shù)據(jù)(為json格式)
            data = requests.get(jxs_url)
            j = data.json()
            # 獲取經(jīng)銷商名稱
            item[key] = j['result']['List'][0]['CompanySimple']
        else:
            # 其他字段時(shí),替換轉(zhuǎn)義字符和空格等為空
            item[key] = info.xpath('.//dd/text()')[0].replace("\r\n","").replace(' ','').replace('\xa0','')

四、數(shù)據(jù)存儲(chǔ)

由于沒(méi)啥反爬,這里直接將采集到的數(shù)據(jù)轉(zhuǎn)化為pandas.DataFrame類型,然后存儲(chǔ)為xlsx文件即可。

df = pd.DataFrame(items)
df = df[['購(gòu)買車型', '購(gòu)買配置', '購(gòu)買地點(diǎn)', '購(gòu)車經(jīng)銷商', '購(gòu)買時(shí)間', '裸車購(gòu)買價(jià)']]
# 數(shù)據(jù)存儲(chǔ)在本地
df.to_excel(r'車輛銷售信息.xlsx',index=None,sheet_name='data')

五、采集結(jié)果預(yù)覽

整個(gè)爬蟲過(guò)程比較簡(jiǎn)單,采集下來(lái)的數(shù)據(jù)也比較規(guī)范,以本文案例奧迪Q5L示例如下:

Image

到此這篇關(guān)于Python爬蟲之自動(dòng)采集某車之家各車銷售數(shù)據(jù)的文章就介紹到這了,更多相關(guān)Python采集汽車銷售數(shù)據(jù)內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python提取xml里面的鏈接源碼詳解

    python提取xml里面的鏈接源碼詳解

    在本篇文章里小編給大家整理的是關(guān)于python提取xml里面的鏈接的相關(guān)知識(shí)點(diǎn)內(nèi)容,需要的朋友們可以學(xué)習(xí)下。
    2019-10-10
  • Python中property函數(shù)用法實(shí)例分析

    Python中property函數(shù)用法實(shí)例分析

    這篇文章主要介紹了Python中property函數(shù)用法,結(jié)合實(shí)例形式分析了property函數(shù)的功能、參數(shù)、使用方法及相關(guān)操作注意事項(xiàng),需要的朋友可以參考下
    2018-06-06
  • Python如何求取逆序數(shù)

    Python如何求取逆序數(shù)

    這篇文章主要介紹了Python如何求取逆序數(shù)問(wèn)題,具有很好的參考價(jià)值,希望大家有所幫助。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2022-12-12
  • Python 實(shí)現(xiàn)微信自動(dòng)回復(fù)的方法

    Python 實(shí)現(xiàn)微信自動(dòng)回復(fù)的方法

    這篇文章主要介紹了Python 實(shí)現(xiàn)微信自動(dòng)回復(fù)的方法,幫助大家更好的理解和使用python,感興趣的朋友可以了解下
    2020-09-09
  • 利用Pandas 創(chuàng)建空的DataFrame方法

    利用Pandas 創(chuàng)建空的DataFrame方法

    下面小編就為大家分享一篇利用Pandas 創(chuàng)建空的DataFrame方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2018-04-04
  • python運(yùn)用sklearn實(shí)現(xiàn)KNN分類算法

    python運(yùn)用sklearn實(shí)現(xiàn)KNN分類算法

    這篇文章主要為大家詳細(xì)介紹了python運(yùn)用sklearn實(shí)現(xiàn)KNN分類算法,文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2019-10-10
  • Python用for循環(huán)實(shí)現(xiàn)九九乘法表

    Python用for循環(huán)實(shí)現(xiàn)九九乘法表

    本文通過(guò)實(shí)例代碼給大家介紹了Python用for循環(huán)實(shí)現(xiàn)九九乘法表的方法,代碼簡(jiǎn)單易懂,非常不錯(cuò),具有一定的參考借鑒價(jià)值,需要的朋友參考下吧
    2018-05-05
  • Opencv常見圖像格式Data Type及代碼實(shí)例

    Opencv常見圖像格式Data Type及代碼實(shí)例

    這篇文章主要介紹了Opencv常見圖像格式Data Type及代碼實(shí)例,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2020-11-11
  • python使用PIL給圖片添加文字生成海報(bào)示例

    python使用PIL給圖片添加文字生成海報(bào)示例

    這篇文章主要介紹了python使用PIL給圖片添加文字生成海報(bào)示例,小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧
    2018-08-08
  • Python中的文本相似度的計(jì)算方法總結(jié)

    Python中的文本相似度的計(jì)算方法總結(jié)

    在自然語(yǔ)言處理(NLP)領(lǐng)域,文本相似度計(jì)算是一個(gè)常見的任務(wù),本文為大家整理了Python中的文本相似度常見計(jì)算方法,希望對(duì)大家有所幫助
    2023-05-05

最新評(píng)論

晴隆县| 安溪县| 金华市| 大悟县| 新和县| 浮山县| 大渡口区| 双峰县| 潼关县| 兴文县| 阿尔山市| 旬邑县| 清原| 抚松县| 海南省| 峡江县| 浦东新区| 海伦市| 万荣县| 溧阳市| 麻城市| 辽宁省| 钟山县| 镇坪县| 锦屏县| 靖安县| 中宁县| 张家港市| 陇川县| 榆林市| 东莞市| 甘南县| 西宁市| 卫辉市| 潞城市| 西乡县| 申扎县| 乳山市| 渭源县| 永仁县| 新野县|