最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python利用正則表達式提取字符串

 更新時間:2016年12月08日 11:02:12   作者:風引  
相信大家在日常工作中經常會遇見在文本中提取特定位置字符串的需求,python的正則性很好,很適合做這類字符串的提取,所以這篇文章就給大家詳細講一下提取的技巧,并通過示例代碼講解,對大家理解很有幫助,有需要的朋友們下面來一起學習學習吧。

前言

正則表達式的基礎知識就不說了,有興趣的可以點擊這里,提取一般分兩種情況,一種是提取在文本中提取單個位置的字符串,另一種是提取連續(xù)多個位置的字符串。日志分析會遇到這種情況,下面我會分別講一下對應的方法。

一、單個位置的字符串提取

這種情況我們可以使用(.+?)這個正則表達式來提取。 舉例,一個字符串"a123b",如果我們想提取ab之間的值123,可以使用findall配合正則表達式,這樣會返回一個包含所以符合情況的list。

代碼如下:

import re
str = "a123b"
print re.findall(r"a(.+?)b",str)#
輸出['123']

1.1貪婪和非貪婪匹配

如果我們有一個字符串”a123b456b”,如果我們想匹配a和最后一個b之間的所有值而非a和第一個出現(xiàn)的b之間的值,可以用?來控制正則貪婪和非貪婪匹配的情況。

代碼如下:

import re
str = "a123b456b"

print re.findall(r"a(.+?)b", str)
#輸出['123']#?控制只匹配0或1個,所以只會輸出和最近的b之間的匹配情況

print re.findall(r"a(.+)b", str)
#輸出['123b456']

print re.findall(r"a(.*)b", str)
#輸出['123b456']

1.2多行匹配

如果你要多行匹配,那么需要加上re.S和re.M標志. 加上re.S后。將會匹配換行符,默認.不會匹配換行符。

代碼如下:

str = "a23b\na34b"

re.findall(r"a(\d+)b.+a(\d+)b", str)
#輸出[]
#因為不能處理str中間有\(zhòng)n換行的情況

re.findall(r"a(\d+)b.+a(\d+)b", str, re.S)
#s輸出[('23', '34')]

加上re.M后,^$標志將會匹配每一行,默認^和$只會匹配第一行。

代碼如下:

str = "a23b\na34b"

re.findall(r"^a(\d+)b", str)
#輸出['23']

re.findall(r"^a(\d+)b", str, re.M)
#輸出['23', '34']

二、連續(xù)多個位置的字符串提取

這種情況我們可以使用(?P<name>…)這個正則表達式來提取。舉例,如果我們有一行webserver的access日志:'192.168.0.1 25/Oct/2012:14:46:34 "GET /api HTTP/1.1" 200 44 "http://abc.com/search" "Mozilla/5.0"',我們想提取這行日志里面所有的內容,可以寫多個(?P<name>expr)來提取,其中name可以更改為你為該位置字符串命名的變量,expr改成提取位置的正則即可。

代碼如下:

import re
line ='192.168.0.1 25/Oct/2012:14:46:34 "GET /api HTTP/1.1" 200 44 "http://abc.com/search" 
"Mozilla/5.0"'
reg = re.compile('^(?P<remote_ip>[^ ]*) (?P<date>[^ ]*) "(?P<request>[^"]*)" 
(?P<status>[^ ]*) (?P<size>[^ ]*) "(?P<referrer>[^"]*)" "(?P<user_agent>[^"]*)"')
regMatch = reg.match(line)
linebits = regMatch.groupdict()
print linebits
for k, v in linebits.items() :
 print k+": "+v

輸出的結果為:

status: 200
referrer: 
request: GET /api HTTP/1.1
user_agent: Mozilla/5.0
date: 25/Oct/2012:14:46:34size: 44
remote_ip: 192.168.0.1

總結

以上就是這篇文章的全部內容了,希望本文的內容對大家的學習或者工作能帶來一定的幫助,如果有疑問大家可以留言交流。

相關文章

  • python 列表,數(shù)組和矩陣sum的用法及區(qū)別介紹

    python 列表,數(shù)組和矩陣sum的用法及區(qū)別介紹

    今天小編就為大家分享一篇python 列表,數(shù)組和矩陣sum的用法及區(qū)別介紹,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-06-06
  • Python中AI圖像識別實現(xiàn)身份證識別

    Python中AI圖像識別實現(xiàn)身份證識別

    圖像識別說白了就是把一張照片上面的文字進行提取,提供工作效率,本文主要介紹了Python 身份證識別,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2021-08-08
  • Python技巧分享之groupby基礎用法詳解

    Python技巧分享之groupby基礎用法詳解

    python中groupby函數(shù)主要的作用是進行數(shù)據(jù)的分組以及分組后地組內運算!本文將通過一些示例和大家詳細講講groupby的基礎用法,需要的可以參考一下
    2022-10-10
  • 對python調用RPC接口的實例詳解

    對python調用RPC接口的實例詳解

    今天小編就為大家分享一篇對python調用RPC接口的實例詳解,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-01-01
  • 在Django中使用Sitemap的方法講解

    在Django中使用Sitemap的方法講解

    這篇文章主要介紹了在Django中使用Sitemap的方法講解,Django是最具人氣的Python web開發(fā)框架,需要的朋友可以參考下
    2015-07-07
  • python語音識別whisper的使用

    python語音識別whisper的使用

    本文主要介紹了python語音識別whisper的使用,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2023-02-02
  • wxPython修改文本框顏色過程解析

    wxPython修改文本框顏色過程解析

    這篇文章主要介紹了wxPython修改文本框顏色過程解析,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-02-02
  • 關于爬蟲中scrapy.Request的更多參數(shù)用法

    關于爬蟲中scrapy.Request的更多參數(shù)用法

    這篇文章主要介紹了關于爬蟲中scrapy.Request的更多參數(shù)用法說明,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2022-07-07
  • Python裝飾器使用實例:驗證參數(shù)合法性

    Python裝飾器使用實例:驗證參數(shù)合法性

    這篇文章主要介紹了Python裝飾器使用實例:驗證參數(shù)合法性,本文直接給出代碼實例,代碼中包含詳細注釋,需要的朋友可以參考下
    2015-06-06
  • Python GUI庫PyQt5樣式QSS子控件介紹

    Python GUI庫PyQt5樣式QSS子控件介紹

    這篇文章主要介紹了Python GUI庫PyQt5樣式QSS子控件介紹,需要的朋友可以參考下
    2020-02-02

最新評論

泸水县| 杂多县| 新安县| 项城市| 吉水县| 五河县| 仁布县| 龙海市| 安吉县| 横峰县| 西青区| 宾川县| 广昌县| 吐鲁番市| 肃北| 沙雅县| 昌平区| 靖州| 乐都县| 沙雅县| 静安区| 新疆| 湖北省| 清河县| 巧家县| 江北区| 通化县| 泰宁县| 南川市| 丰宁| 河南省| 迁西县| 湖口县| 井冈山市| 台北县| 友谊县| 个旧市| 兴宁市| 贡觉县| 湘乡市| 合川市|