SpringBoot集成antlr實現(xiàn)詞法和語法分析
1.什么是antlr?
Antlr4 是一款強大的語法生成器工具,可用于讀取、處理、執(zhí)行和翻譯結(jié)構(gòu)化的文本或二進制文件。基本上是當(dāng)前 Java 語言中使用最為廣泛的語法生成器工具。Twitter搜索使用ANTLR進行語法分析,每天處理超過20億次查詢;Hadoop生態(tài)系統(tǒng)中的Hive、Pig、數(shù)據(jù)倉庫和分析系統(tǒng)所使用的語言都用到了ANTLR;Lex Machina將ANTLR用于分析法律文本;Oracle公司在SQL開發(fā)者IDE和遷移工具中使用了ANTLR;NetBeans公司的IDE使用ANTLR來解析C++;Hibernate對象-關(guān)系映射框架(ORM)使用ANTLR來處理HQL語言
基本概念
語法分析器(parser)是用來識別語言的程序,本身包含兩個部分:詞法分析器(lexer)和語法分析器(parser)。詞法分析階段主要解決的關(guān)鍵詞以及各種標(biāo)識符,例如 INT、ID 等,語法分析主要是基于詞法分析的結(jié)果,構(gòu)造一顆語法分析樹。大致的流程如下圖參考2所示。

因此,為了讓詞法分析和語法分析能夠正常工作,在使用 Antlr4 的時候,需要定義語法(grammar),這部分就是 Antlr 元語言。

使用 ANTLR4 編程的基本流程是固定的,通常分為如下三步:
基于需求按照 ANTLR4 的規(guī)則編寫自定義語法的語義規(guī)則, 保存成以 g4 為后綴的文件。
使用 ANTLR4 工具處理 g4 文件,生成詞法分析器、句法分析器代碼、詞典文件。
編寫代碼繼承 Visitor 類或?qū)崿F(xiàn) Listener 接口,開發(fā)自己的業(yè)務(wù)邏輯代碼。
Listener 模式和 Visitor 模式的區(qū)別
Listener 模式:

Visitor 模式:

- Listener 模式通過 walker 對象自行遍歷,不用考慮其語法樹上下級關(guān)系。Vistor 需要自行控制訪問的子節(jié)點,如果遺漏了某個子節(jié)點,那么整個子節(jié)點都訪問不到了。
- Listener 模式的方法沒有返回值,Vistor 模式可以設(shè)定任意返回值。
- Listener 模式的訪問棧清晰明確,Vistor 模式是方法調(diào)用棧,如果實現(xiàn)出錯有可能導(dǎo)致 StackOverFlow。
2.代碼工程
實驗?zāi)康模簩崿F(xiàn)基于antlr的計算器
pom.xml
<?xml version="1.0" encoding="UTF-8"?>
<project xmlns="http://maven.apache.org/POM/4.0.0"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">
<parent>
<artifactId>springboot-demo</artifactId>
<groupId>com.et</groupId>
<version>1.0-SNAPSHOT</version>
</parent>
<modelVersion>4.0.0</modelVersion>
<artifactId>ANTLR</artifactId>
<properties>
<maven.compiler.source>8</maven.compiler.source>
<maven.compiler.target>8</maven.compiler.target>
<antlr4.version>4.9.1</antlr4.version>
</properties>
<dependencies>
<dependency>
<groupId>org.springframework.boot</groupId>
<artifactId>spring-boot-starter-web</artifactId>
</dependency>
<dependency>
<groupId>org.springframework.boot</groupId>
<artifactId>spring-boot-autoconfigure</artifactId>
</dependency>
<dependency>
<groupId>org.springframework.boot</groupId>
<artifactId>spring-boot-starter-test</artifactId>
<scope>test</scope>
</dependency>
<dependency>
<groupId>org.antlr</groupId>
<artifactId>antlr4-runtime</artifactId>
<version>${antlr4.version}</version>
</dependency>
</dependencies>
<build>
<plugins>
<plugin>
<groupId>org.antlr</groupId>
<artifactId>antlr4-maven-plugin</artifactId>
<version>${antlr4.version}</version>
<configuration>
<sourceDirectory>src/main/java</sourceDirectory>
<outputDirectory>src/main/java</outputDirectory>
<arguments>
<argument>-visitor</argument>
<argument>-listener</argument>
</arguments>
</configuration>
<executions>
<execution>
<goals>
<goal>antlr4</goal>
</goals>
</execution>
</executions>
</plugin>
</plugins>
</build>
</project>
元語言LabeledExpr.g4
grammar LabeledExpr; // rename to distinguish from Expr.g4
prog: stat+ ;
stat: expr NEWLINE # printExpr
| ID '=' expr NEWLINE # assign
| NEWLINE # blank
;
expr: expr op=('*'|'/') expr # MulDiv
| expr op=('+'|'-') expr # AddSub
| INT # int
| ID # id
| '(' expr ')' # parens
;
MUL : '*' ; // assigns token name to '*' used above in grammar
DIV : '/' ;
ADD : '+' ;
SUB : '-' ;
ID : [a-zA-Z]+ ; // match identifiers
INT : [0-9]+ ; // match integers
NEWLINE:'\r'? '\n' ; // return newlines to parser (is end-statement signal)
WS : [ \t]+ -> skip ; // toss out whitespace
簡單解讀一下 LabeledExpr.g4 文件。ANTLR4 規(guī)則是基于正則表達式定義定義。規(guī)則的理解是自頂向下的,每個分號結(jié)束的語句表示一個規(guī)則 。例如第一行:grammar LabeledExpr; 表示我們的語法名稱是 LabeledExpr, 這個名字需要跟文件名需要保持一致。Java 編碼也有相似的規(guī)則:類名跟類文件一致。
- 規(guī)則 prog 表示 prog 是一個或多個 stat。
- 規(guī)則 stat 適配三種子規(guī)則:空行、表達式 expr、賦值表達式 ID’=’expr。
- 表達式 expr 適配五種子規(guī)則:乘除法、加減法、整型、ID、括號表達式。很顯然,這是一個遞歸的定義。
最后定義的是組成復(fù)合規(guī)則的基礎(chǔ)元素,比如:規(guī)則 **ID: [a-zA-Z]+**表示 ID 限于大小寫英文字符串;INT: [0-9]+; 表示 INT 這個規(guī)則是 0-9 之間的一個或多個數(shù)字,當(dāng)然這個定義其實并不嚴(yán)格。再嚴(yán)格一點,應(yīng)該限制其長度。
在理解正則表達式的基礎(chǔ)上,ANTLR4 的 g4 語法規(guī)則還是比較好理解的。
定義 ANTLR4 規(guī)則需要注意一種情況,即可能出現(xiàn)一個字符串同時支持多種規(guī)則,如以下的兩個規(guī)則:
ID: [a-zA-Z]+;
FROM: ‘from’;
很明顯,字符串” from”同時滿足上述兩個規(guī)則,ANTLR4 處理的方式是按照定義的順序決定。這里 ID 定義在 FROM 前面,所以字符串 from 會優(yōu)先匹配到 ID 這個規(guī)則上。
其實在定義好與法規(guī)中,編寫完成 g4 文件后,ANTLR4 已經(jīng)為我們完成了 50%的工作:幫我們實現(xiàn)了整個架構(gòu)及接口了,剩下的開發(fā)工作就是基于接口或抽象類進行具體的實現(xiàn)。實現(xiàn)上有兩種方式來處理生成的語法樹,其一 Visitor 模式,另一種方式是 Listener(監(jiān)聽器模式)。
生成詞法和語法解析器
基于maven插件生成
<plugin>
<groupId>org.antlr</groupId>
<artifactId>antlr4-maven-plugin</artifactId>
<version>${antlr4.version}</version>
<configuration>
<sourceDirectory>src/main/java</sourceDirectory>
<outputDirectory>src/main/java</outputDirectory>
<arguments>
<argument>-visitor</argument>
<argument>-listener</argument>
</arguments>
</configuration>
<executions>
<execution>
<goals>
<goal>antlr4</goal>
</goals>
</execution>
</executions>
</plugin>
執(zhí)行命令
mvn antlr4:antlr4

使用ideal插件生成


實現(xiàn)運算邏輯
第一種:基于visitor實現(xiàn)
package com.et.antlr;
import java.util.HashMap;
import java.util.Map;
public class EvalVisitor extends LabeledExprBaseVisitor<Integer> {
// Store variables (for assignment)
Map<String, Integer> memory = new HashMap<>();
/** stat : expr NEWLINE */
@Override
public Integer visitPrintExpr(LabeledExprParser.PrintExprContext ctx) {
Integer value = visit(ctx.expr()); // evaluate the expr child
// System.out.println(value); // print the result
return value; // return dummy value
}
/** stat : ID '=' expr NEWLINE */
@Override
public Integer visitAssign(LabeledExprParser.AssignContext ctx) {
String id = ctx.ID().getText(); // id is left-hand side of '='
int value = visit(ctx.expr()); // compute value of expression on right
memory.put(id, value); // store it in our memory
return value;
}
/** expr : expr op=('*'|'/') expr */
@Override
public Integer visitMulDiv(LabeledExprParser.MulDivContext ctx) {
int left = visit(ctx.expr(0)); // get value of left subexpression
int right = visit(ctx.expr(1)); // get value of right subexpression
if (ctx.op.getType() == LabeledExprParser.MUL) return left * right;
return left / right; // must be DIV
}
/** expr : expr op=('+'|'-') expr */
@Override
public Integer visitAddSub(LabeledExprParser.AddSubContext ctx) {
int left = visit(ctx.expr(0)); // get value of left subexpression
int right = visit(ctx.expr(1)); // get value of right subexpression
if (ctx.op.getType() == LabeledExprParser.ADD) return left + right;
return left - right; // must be SUB
}
/** expr : INT */
@Override
public Integer visitInt(LabeledExprParser.IntContext ctx) {
return Integer.valueOf(ctx.INT().getText());
}
/** expr : ID */
@Override
public Integer visitId(LabeledExprParser.IdContext ctx) {
String id = ctx.ID().getText();
if (memory.containsKey(id)) return memory.get(id);
return 0; // default value if the variable is not found
}
/** expr : '(' expr ')' */
@Override
public Integer visitParens(LabeledExprParser.ParensContext ctx) {
return visit(ctx.expr()); // return child expr's value
}
/** stat : NEWLINE */
@Override
public Integer visitBlank(LabeledExprParser.BlankContext ctx) {
return 0; // return dummy value
}
}
第二種:基于listener實現(xiàn)
package com.et.antlr;
import org.antlr.v4.runtime.tree.ParseTreeProperty;
import org.antlr.v4.runtime.tree.TerminalNode;
import java.util.HashMap;
import java.util.Map;
public class EvalListener extends LabeledExprBaseListener {
// Store variables (for assignment)
private final Map<String, Integer> memory = new HashMap<>();
// Store expression results
private final ParseTreeProperty<Integer> values = new ParseTreeProperty<>();
private int result=0;
@Override
public void exitPrintExpr(LabeledExprParser.PrintExprContext ctx) {
int value = values.get(ctx.expr());
//System.out.println(value);
result=value;
}
public int getResult() {
return result;
}
@Override
public void exitAssign(LabeledExprParser.AssignContext ctx) {
String id = ctx.ID().getText();
int value = values.get(ctx.expr());
memory.put(id, value);
}
@Override
public void exitMulDiv(LabeledExprParser.MulDivContext ctx) {
int left = values.get(ctx.expr(0));
int right = values.get(ctx.expr(1));
if (ctx.op.getType() == LabeledExprParser.MUL) {
values.put(ctx, left * right);
} else {
values.put(ctx, left / right);
}
}
@Override
public void exitAddSub(LabeledExprParser.AddSubContext ctx) {
int left = values.get(ctx.expr(0));
int right = values.get(ctx.expr(1));
if (ctx.op.getType() == LabeledExprParser.ADD) {
values.put(ctx, left + right);
} else {
values.put(ctx, left - right);
}
}
@Override
public void exitInt(LabeledExprParser.IntContext ctx) {
int value = Integer.parseInt(ctx.INT().getText());
values.put(ctx, value);
}
@Override
public void exitId(LabeledExprParser.IdContext ctx) {
String id = ctx.ID().getText();
if (memory.containsKey(id)) {
values.put(ctx, memory.get(id));
} else {
values.put(ctx, 0); // default value if the variable is not found
}
}
@Override
public void exitParens(LabeledExprParser.ParensContext ctx) {
values.put(ctx, values.get(ctx.expr()));
}
}
以上只是一些關(guān)鍵代碼,所有代碼請參見下面代碼倉庫
代碼倉庫
3.測試
測試vistor方式
package com.et.antlr; /***
* Excerpted from "The Definitive ANTLR 4 Reference",
* published by The Pragmatic Bookshelf.
* Copyrights apply to this code. It may not be used to create training material,
* courses, books, articles, and the like. Contact us if you are in doubt.
* We make no guarantees that this code is fit for any purpose.
* Visit http://www.pragmaticprogrammer.com/titles/tpantlr2 for more book information.
***/
import org.antlr.v4.runtime.*;
import org.antlr.v4.runtime.tree.ParseTree;
import java.io.FileInputStream;
import java.io.InputStream;
public class CalcByVisit {
public static void main(String[] args) throws Exception {
/* String inputFile = null;
if ( args.length>0 ) inputFile = args[0];
InputStream is = System.in;
if ( inputFile!=null ) is = new FileInputStream(inputFile);*/
ANTLRInputStream input = new ANTLRInputStream("1+2*3\n");
LabeledExprLexer lexer = new LabeledExprLexer(input);
CommonTokenStream tokens = new CommonTokenStream(lexer);
LabeledExprParser parser = new LabeledExprParser(tokens);
ParseTree tree = parser.prog(); // parse
EvalVisitor eval = new EvalVisitor();
int result =eval.visit(tree);
System.out.println(result);
}
}
測試listener方式
package com.et.antlr;
import org.antlr.v4.runtime.ANTLRInputStream;
import org.antlr.v4.runtime.CommonTokenStream;
import org.antlr.v4.runtime.tree.ParseTree;
import org.antlr.v4.runtime.tree.ParseTreeWalker;
import java.io.FileInputStream;
import java.io.IOException;
import java.io.InputStream;
/**
* @author liuhaihua
* @version 1.0
* @ClassName CalbyLisenter
* @Description todo
* @date 2024年06月06日 16:40
*/
public class CalbyLisener {
public static void main(String[] args) throws IOException {
/* String inputFile = null;
if ( args.length>0 ) inputFile = args[0];
InputStream is = System.in;
if ( inputFile!=null ) is = new FileInputStream(inputFile);*/
ANTLRInputStream input = new ANTLRInputStream("1+2*3\n");
LabeledExprLexer lexer = new LabeledExprLexer(input);
CommonTokenStream tokens = new CommonTokenStream(lexer);
LabeledExprParser parser = new LabeledExprParser(tokens);
ParseTree tree = parser.prog(); // parse
ParseTreeWalker walker = new ParseTreeWalker();
EvalListener evalListener =new EvalListener();
walker.walk(evalListener, tree);
int result=evalListener.getResult();
System.out.println(result);
}
}
運行上述測試用例,計算結(jié)果符合預(yù)期
4.引用
以上就是SpringBoot集成antlr實現(xiàn)詞法和語法分析的詳細(xì)內(nèi)容,更多關(guān)于SpringBoot antlr詞法和語法分析的資料請關(guān)注腳本之家其它相關(guān)文章!
相關(guān)文章
MyBatisPlus自定義JsonTypeHandler實現(xiàn)自動轉(zhuǎn)化JSON問題
這篇文章主要介紹了MyBatisPlus自定義JsonTypeHandler實現(xiàn)自動轉(zhuǎn)化JSON問題,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教2023-12-12
Java設(shè)計模塊系列之書店管理系統(tǒng)單機版(二)
這篇文章主要為大家詳細(xì)介紹了Java單機版的書店管理系統(tǒng)設(shè)計模塊和思想第二章,感興趣的小伙伴們可以參考一下2016-08-08
Spring Boot3 集成 Spring AI 實現(xiàn) A
Spring AI的Advisor API是一種聲明式的攔截機制,借鑒了 Spring AOP 的設(shè)計理念,允許開發(fā)者在AI交互的生命周期關(guān)鍵節(jié)點插入自定義邏輯,本文全面介紹了Spring Boot集成Spring AI 1.0.0 實現(xiàn) Advisor 增強機制的完整流程,感興趣的朋友跟隨小編一起看看吧2026-03-03

