最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python正則抓取網(wǎng)易新聞的方法示例

 更新時(shí)間:2017年04月21日 14:37:22   作者:我要的shine  
這篇文章主要介紹了Python正則抓取網(wǎng)易新聞的方法,結(jié)合實(shí)例形式較為詳細(xì)的分析了Python使用正則進(jìn)行網(wǎng)易新聞抓取操作的相關(guān)實(shí)現(xiàn)技巧與注意事項(xiàng),需要的朋友可以參考下

本文實(shí)例講述了Python正則抓取網(wǎng)易新聞的方法。分享給大家供大家參考,具體如下:

自己寫(xiě)了些關(guān)于抓取網(wǎng)易新聞的爬蟲(chóng),發(fā)現(xiàn)其網(wǎng)頁(yè)源代碼與網(wǎng)頁(yè)的評(píng)論根本就對(duì)不上,所以,采用了抓包工具得到了其評(píng)論的隱藏地址(每個(gè)瀏覽器都有自己的抓包工具,都可以用來(lái)分析網(wǎng)站)

如果仔細(xì)觀察的話就會(huì)發(fā)現(xiàn),有一個(gè)特殊的,那么這個(gè)就是自己想要的了

然后打開(kāi)鏈接就可以找到相關(guān)的評(píng)論內(nèi)容了。(下圖為第一頁(yè)內(nèi)容)

接下來(lái)就是代碼了(也照著大神的改改寫(xiě)寫(xiě)了)。

#coding=utf-8
import urllib2
import re
import json
import time
class WY():
  def __init__(self):
    self.headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 5.1) AppleWebKit/534.24 (KHTML, like '}
    self.url='http://comment.news.163.com/data/news3_bbs/df/B9IBDHEH000146BE_1.html'
  def getpage(self,page):
    full_url='http://comment.news.163.com/cache/newlist/news3_bbs/B9IBDHEH000146BE_'+str(page)+'.html'
    return full_url
  def gethtml(self,page):
    try:
      req=urllib2.Request(page,None,self.headers)
      response = urllib2.urlopen(req)
      html = response.read()
      return html
    except urllib2.URLError,e:
      if hasattr(e,'reason'):
        print u"連接失敗",e.reason
        return None
  #處理字符串
  def Process(self,data,page):
    if page == 1:
      data=data.replace('var replyData=','')
    else:
      data=data.replace('var newPostList=','')
    reg1=re.compile(" \[<a href=''>")
    data=reg1.sub(' ',data)
    reg2=re.compile('<\\\/a>\]')
    data=reg2.sub('',data)
    reg3=re.compile('<br>')
    data=reg3.sub('',data)
    return data
  #解析json
  def dealJSON(self):
    with open("WY.txt","a") as file:
      file.write('ID'+'|'+'評(píng)論'+'|'+'踩'+'|'+'頂'+'\n')
    for i in range(1,12):
      if i == 1:
        data=self.gethtml(self.url)
        data=self.Process(data,i)[:-1]
        value=json.loads(data)
        file=open('WY.txt','a')
        for item in value['hotPosts']:
          try:
            file.write(item['1']['f'].encode('utf-8')+'|')
            file.write(item['1']['b'].encode('utf-8')+'|')
            file.write(item['1']['a'].encode('utf-8')+'|')
            file.write(item['1']['v'].encode('utf-8')+'\n')
          except:
            continue
        file.close()
        print '--正在采集%d/12--'%i
        time.sleep(5)
      else:
        page=self.getpage(i)
        data = self.gethtml(page)
        data = self.Process(data,i)[:-2]
        # print data
        value=json.loads(data)
        # print value
        file=open('WY.txt','a')
        for item in value['newPosts']:
          try:
            file.write(item['1']['f'].encode('utf-8')+'|')
            file.write(item['1']['b'].encode('utf-8')+'|')
            file.write(item['1']['a'].encode('utf-8')+'|')
            file.write(item['1']['v'].encode('utf-8')+'\n')
          except:
            continue
        file.close()
        print '--正在采集%d/12--'%i
        time.sleep(5)
if __name__ == '__main__':
  WY().dealJSON()

以上就是我爬取的代碼了。

PS:這里再為大家提供2款非常方便的正則表達(dá)式工具供大家參考使用:

JavaScript正則表達(dá)式在線測(cè)試工具:
http://tools.jb51.net/regex/javascript

正則表達(dá)式在線生成工具:
http://tools.jb51.net/regex/create_reg

更多關(guān)于Python相關(guān)內(nèi)容可查看本站專題:《Python正則表達(dá)式用法總結(jié)》、《Python數(shù)據(jù)結(jié)構(gòu)與算法教程》、《Python Socket編程技巧總結(jié)》、《Python函數(shù)使用技巧總結(jié)》、《Python字符串操作技巧匯總》、《Python入門(mén)與進(jìn)階經(jīng)典教程》及《Python文件與目錄操作技巧匯總

希望本文所述對(duì)大家Python程序設(shè)計(jì)有所幫助。

相關(guān)文章

最新評(píng)論

商洛市| 响水县| 井陉县| 长武县| 宜川县| 岳西县| 德阳市| 鄂伦春自治旗| 永胜县| 北川| 鄄城县| 黄平县| 西乌珠穆沁旗| 吉林省| 东山县| 龙里县| 图木舒克市| 黑水县| 阳原县| 新巴尔虎右旗| 新泰市| 东至县| 安乡县| 张家港市| 萝北县| 金坛市| 缙云县| 阜城县| 扎兰屯市| 前郭尔| 蚌埠市| 盐池县| 华池县| 大姚县| 白玉县| 泰顺县| 格尔木市| 新兴县| 科技| 金阳县| 邳州市|