手写状态机比正则更可控,因c++缺乏线程安全且上下文敏感的正则引擎,而词法分析需状态记忆(如嵌套注释、转义处理);状态机逐字符推进、分支明确、易于调试和扩展。

为什么手写状态机比直接用正则更可控
因为 C++ 没有内置的、线程安全又支持上下文敏感的正则引擎,而脚本词法(比如支持 // 注释、/* */ 嵌套注释、字符串中转义)往往需要状态记忆。正则在边界 case 上容易漏匹配或回溯爆炸,比如 "hello\"world" 里的反斜杠处理,状态机可以逐字符推进、明确分支,调试时也容易打点定位。
实操建议:
- 把状态定义为
enum class State { Start, InNumber, InString, InComment, ... };,避免 magic number - 每个状态只响应当前字符做**单次转移**,不预读、不回退(除非明确需要,如识别
=和==) - 用
std::string_view记录 token 起止位置,避免频繁拷贝;实际生成Token时再切片
如何处理双分隔符和嵌套注释这类典型冲突
最常见坑是:遇到 / 后,既可能是除法运算符,也可能是注释开始,还可能是浮点数字面量(如 1.5/2)——但此时前面是数字,所以不能进注释逻辑。关键不是“看到 / 就猜”,而是**结合前一状态判断**。
实操建议:
-
State::Start下遇到/→ 进入State::MaybeComment;State::InNumber下遇到/→ 直接产出TokDivide -
State::MaybeComment下若下一字符是*→ 进State::InBlockComment;若是/→ 进State::InLineComment;否则退回State::Start并回滚一个字符(用索引减 1) - 嵌套注释(
/* /* inner */ outer */)不推荐手写支持——标准 C/C++ 也不支持,强行实现会大幅增加状态数和出错概率;若真需,改用计数器 +State::InBlockComment内部子状态
Token 结构设计要预留哪些扩展字段
很多人一开始只存 type 和 lexeme,结果后续加行号、列号、原始源码偏移时全得重构。C++ 里尤其要注意 std::string_view 的生命周期依赖原始输入缓冲区。
组合式C++代码评审方案,融合静态分析、AI推理、多轮迭代评审和C++专项检查,适用于PR审查、增量代码审查、全项目评审和代码质量评分,触发词包括review cpp、cpp代码评审、C++review、代码审查。
实操建议:
-
struct Token { TokenType type; std::string_view lexeme; size_t line; size_t column; size_t offset; };——offset是绝对位置,方便后续错误定位和语法分析器跳转 - 不要在
Token里存std::string;如果必须拥有内容(如宏展开后字符串),单独提供Token::str()方法按需构造 - 为关键字预建哈希表(
std::unordered_set<:string_view></:string_view>),而不是每次 strcmp;注意 C++20 要求std::string_view哈希可用
完整可运行的最小骨架代码怎么组织
不是贴几百行,而是给出能编译、能跑通基础 case 的核心骨架。重点是状态流转闭环和 token 输出时机。
示例关键片段(省略头文件和 namespace):
enum class TokenType {
TokIdent, TokNumber, TokString, TokSlash, TokStar, TokEof
};
<p>struct Token {
TokenType type;
std::string_view lexeme;
size_t line = 1, column = 1;
};</p><p>class Lexer {
std::string<em>view src</em>;
size<em>t pos</em> = 0;
size<em>t line</em> = 1, col_ = 1;</p><p>public:
explicit Lexer(std::string<em>view s) : src</em>(s) {}</p><p>Token next() {
skipWhitespace();
if (pos<em> >= src</em>.size()) return {TokEof, {}, line<em>, col</em>};</p><pre class="brush:php;toolbar:false;">char c = src_[pos_];
switch (c) {
case '/':
++pos_; ++col_;
if (pos_ <p>}</p><p>private:
void skipWhitespace() {
while (pos<em> .size()) {
char c = src<em>[pos</em>];
if (c == '\n') { ++line<em>; col</em> = 1; }
else if (c == '\t') col<em> += 4;
else if (c == ' ') ++col</em>;
else break;
++pos_;
}
}</em></p><p>Token scanNumber() {
size<em>t start = pos</em>;
while (pos<em> .size() && std::isdigit(src<em>[pos</em>])) ++pos<em>;
return {TokNumber, src</em>.substr(start, pos<em> - start), line</em>, col_};
}
};</em></p>真正难的不是写完这个,而是当你要支持十六进制字面量、科学计数法、Unicode 标识符、BOM 处理时,每个新增规则都会扰动已有状态转移条件——这时候没有测试用例覆盖的状态组合,很容易引入静默错误。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!










