Bash中使用正則表達(dá)式進(jìn)行文本處理指南
前言
在 Bash 腳本中,可以使用正則表達(dá)式來(lái)進(jìn)行文本處理,最常用的工具是 grep、sed 和 awk。
1.1 示例
舉個(gè)簡(jiǎn)單的例子,假設(shè)你有一個(gè)文本文件 example.txt,你想查找包含特定模式的行。
你可以使用 grep:
grep 'pattern' example.txt
如果你想對(duì)文本進(jìn)行替換,可以用 sed:
sed 's/old_pattern/new_pattern/g' example.txt
對(duì)于更復(fù)雜的文本處理,例如統(tǒng)計(jì)、格式化,你可以用 awk:
awk '/pattern/ {print $0}' example.txt
1.2 知識(shí)擴(kuò)展
1)grep:
grep 是最基礎(chǔ)的文本搜索工具,它支持基本和擴(kuò)展的正則表達(dá)式。
例子:
- 查找包含數(shù)字的行: grep ‘[0-9]’ example.txt
- 忽略大小寫查找:grep -i ‘pattern’ example.txt
- 查找并顯示行號(hào):grep -n ‘pattern’ example.txt
- 遞歸查找:grep -r ‘pattern’ /path/to/directory
2)sed:
sed 是一個(gè)流編輯器,用于對(duì)文本進(jìn)行篩選和替換。
例子:
- 替換文件中第一次出現(xiàn)的匹配:sed ‘s/pattern/replacement/’ example.txt
- 替換整個(gè)文件中的所有匹配:sed ‘s/pattern/replacement/g’ example.txt
- 刪除包含特定模式的行:sed ‘/pattern/d’ example.txt
- 在特定模式后添加文本:sed ‘/pattern/a\new text’ example.txt
3)awk:
awk 是一個(gè)強(qiáng)大的文本處理工具,適用于格式化報(bào)告和統(tǒng)計(jì)分析。
例子:
- 查找并打印匹配的行:awk ‘/pattern/ {print $0}’ example.txt
- 分隔特定字段并打?。篴wk -F: ‘{print $1}’ example.txt(假設(shè)文件以冒號(hào)分隔)
- 統(tǒng)計(jì)出現(xiàn)次數(shù):awk ‘/pattern/ {count++} END {print count}’ example.txt
進(jìn)階內(nèi)容
1)復(fù)雜模式匹配
使用擴(kuò)展正則表達(dá)式:通過添加 -E 參數(shù),你可以讓 grep 使用擴(kuò)展正則:grep -E ‘pattern1|pattern2’ example.txt。
同理,你也可以在 sed 中使用擴(kuò)展正則:sed -E ‘s/old_pattern(new_pattern)/replacement/g’ example.txt
2)結(jié)合工具使用
你可以將這幾個(gè)工具組合使用,以實(shí)現(xiàn)更復(fù)雜的文本處理任務(wù)。例如,先用 grep 篩選,再用 awk 處理:
grep 'pattern' example.txt | awk '{print $1}'
1.3 實(shí)踐指南
一、核心處理方式
- 原生Bash正則匹配
if [[ "string" =~ ^regex_pattern$ ]]; then
echo "匹配成功"
echo "捕獲組:${BASH_REMATCH[1]}"
fi
- 高級(jí)參數(shù)擴(kuò)展
var="2024-07-25_log.txt"
echo ${var//[^0-9]/} # 刪除非數(shù)字字符 → 20240725
echo ${var/#*_/} # 去除前綴保留文件名 → log.txt
二、常用工具鏈
| 工具 | 能力范圍 | 典型用例 |
|---|---|---|
| grep | 模式搜索過濾 | `grep -E 'error |
| sed | 流式編輯替換 | sed -E ‘s/(\d{4})-(\d{2})/\2/\1/g’ |
| awk | 結(jié)構(gòu)化字段處理 | awk ‘/GET/ && $9==200 {print $7}’ log |
| perl | PCRE高級(jí)正則 | perl -pe ‘s/\b\d+\b/NUM/g’ |
三、正則表達(dá)式類型
# 基礎(chǔ)正則(BRE)
grep '^From: .*@ctc.com$' emails.txt
# 擴(kuò)展正則(ERE)
grep -E '[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z]{2,4}' contacts.txt
# Perl兼容正則(PCRE)
grep -P '\d{4}-\d{2}-\d{2}T\d{2}:\d{2}Z' timestamps.log
四、實(shí)戰(zhàn)案例
- 日志分析
# 提取HTTP狀態(tài)碼非200的請(qǐng)求
tail -f access.log | awk 'match($0, /HTTP\/1\.1" ([0-9]{3})/, arr) && arr[1] != 200'
- 數(shù)據(jù)清洗
# 標(biāo)準(zhǔn)化電話號(hào)碼格式
sed -E 's/(\+86)?[ ]*([0-9]{3})-?([0-9]{4})-?([0-9]{4})/\1 \2-\3-\4/' contacts.csv
- 安全檢測(cè)
# 檢測(cè)SQL注入特征 grep -P '(union\s+select|sleep\(\d+\)|benchmark\(|\b(and|or)\b.+=[^'"'"']*["'"'"]\s*["'"'"])' web_logs
五、性能優(yōu)化建議
- 優(yōu)先使用原生Bash操作避免子進(jìn)程開銷
- 復(fù)雜匹配使用預(yù)編譯正則(如awk/perl)
- 大文件處理時(shí)結(jié)合LC_ALL=C提升ASCII處理速度
- 避免貪婪匹配.*改用精準(zhǔn)限定符
六、調(diào)試技巧
# 可視化匹配過程 grep --color=auto -nE 'pattern' file # 測(cè)試正則表達(dá)式 pcre2test # 專用測(cè)試工具
總結(jié)
到此這篇關(guān)于Bash中使用正則表達(dá)式進(jìn)行文本處理的文章就介紹到這了,更多相關(guān)Bash正則表達(dá)式文本處理內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
awk腳本統(tǒng)計(jì)一組單詞中字母出現(xiàn)最多最少頻率
這篇文章主要介紹編寫一個(gè) awk 腳本來(lái)找到一組單詞中出現(xiàn)次數(shù)最多(和最少)的單詞頻率,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2022-03-03
Linux下自動(dòng)刪除過期備份和自動(dòng)異地備份的腳本
這篇文章主要介紹了Linux下自動(dòng)刪除過期備份和自動(dòng)異地備份,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2022-09-09
Linux 進(jìn)程替換(exec函數(shù))實(shí)現(xiàn)代碼
這篇文章主要介紹了Linux 進(jìn)程替換(exec函數(shù))實(shí)現(xiàn)代碼的相關(guān)資料,需要的朋友可以參考下2017-05-05

