php小编小新在这里为大家介绍一种非常有趣的技术——分词表示意外的标记。分词是自然语言处理中的一个重要任务,它将一段文本按照一定的规则进行切分,得到一系列的词语。而在分词过程中,我们有时会遇到一些特殊的情况,比如在某些词语中出现了意外的标记,这可能会对后续的处理造成困扰。因此,研究如何表示和处理这种意外的标记就变得非常重要。在本文中,我们将介绍一些常见的意外标记,并给出相应的解决方案,希望能对大家有所帮助。
问题内容
我正在玩一个分词来学习如何解析,但我无法确定为什么这是意外的。
// nolint: golint, dupl package main import ( "fmt" "io" "github.com/alecthomas/participle/v2" "github.com/alecthomas/participle/v2/lexer" ) var htaccesslexer = lexer.mustsimple([]lexer.simplerule{ {"comment", `^#[^\n]*`}, {"ident", `^\w+`}, {"int", `\d+`}, {"string", `("(\\"|[^"])*"|\s+)`}, {"eol", `[\n\r]+`}, {"whitespace", `[ \t]+`}, }) type htaccess struct { directives []*directive `@@*` } type directive struct { pos lexer.position errordocument *errordocument `@@` } type errordocument struct { code int `"errordocument" @int` path string `@string` } var htaccessparser = participle.mustbuild[htaccess]( participle.lexer(htaccesslexer), participle.caseinsensitive("ident"), participle.unquote("string"), participle.elide("whitespace"), ) func parse(r io.reader) (*htaccess, error) { program, err := htaccessparser.parse("", r) if err != nil { return nil, err } return program, nil } func main() { v, err := htaccessparser.parsestring("", `errordocument 403 test`) if err != nil { panic(err) } fmt.println(v) }
据我所知,这似乎是正确的,我期望 403 在那里,但我不确定为什么它不识别它。
编辑: 我将词法分析器更改为:
var htaccessLexer = lexer.MustSimple([]lexer.SimpleRule{ {"dir", `^\w+`}, {"int", `\d+`}, {"str", `("(\\"|[^"])*"|\S+)`}, {"EOL", `[\n\r]+`}, {"whitespace", `\s+`}, })
错误消失了,但它仍然打印一个空数组,不知道为什么。我也不确定为什么对词法分析器使用不同的值可以修复它。
解决方法
我相信我发现了问题,这是顺序,ident 通过 \w 标签在我的词法分析器中查找数字,因此这导致我的整数被标记为 ident。
我发现我必须将 quotedstrings 和 unquotedstrings 分开,否则未加引号的字符串会获取整数。或者,我可以确保它只获取非数字值,但这会错过 stringwithnum2
之类的东西
这是我的解决方案
var htaccesslexer = lexer.mustsimple([]lexer.simplerule{ {"comment", `(?i)#[^\n]*`}, {"quotedstring", `"(\\"|[^"])*"`}, {"number", `[-+]?(\d*\.)?\d+`}, {"unquotedstring", `[^ \t]+`}, {"ident", `^[a-za-z_]`}, {"eol", `[\n\r]+`}, {"whitespace", `[ \t]+`}, })
type ErrorDocument struct { Pos lexer.Position Code int `"ErrorDocument" @Number` Path string `(@QuotedString | @UnQuotedString)` }
这解决了我的问题,因为它现在查找带引号的字符串,然后查找数字,然后查找不带引号的字符串。
以上是分词表示意外的标记的详细内容。更多信息请关注PHP中文网其他相关文章!

Go语言的核心特性包括垃圾回收、静态链接和并发支持。1.Go语言的并发模型通过goroutine和channel实现高效并发编程。2.接口和多态性通过实现接口方法,使得不同类型可以统一处理。3.基本用法展示了函数定义和调用的高效性。4.高级用法中,切片提供了动态调整大小的强大功能。5.常见错误如竞态条件可以通过gotest-race检测并解决。6.性能优化通过sync.Pool重用对象,减少垃圾回收压力。

Go语言在构建高效且可扩展的系统中表现出色,其优势包括:1.高性能:编译成机器码,运行速度快;2.并发编程:通过goroutines和channels简化多任务处理;3.简洁性:语法简洁,降低学习和维护成本;4.跨平台:支持跨平台编译,方便部署。

关于SQL查询结果排序的疑惑学习SQL的过程中,常常会遇到一些令人困惑的问题。最近,笔者在阅读《MICK-SQL基础�...

golang ...

Go语言中如何对比并处理三个结构体在Go语言编程中,有时需要对比两个结构体的差异,并将这些差异应用到第�...

GoLand中自定义结构体标签不显示怎么办?在使用GoLand进行Go语言开发时,很多开发者会遇到自定义结构体标签在�...


热AI工具

Undresser.AI Undress
人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover
用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool
免费脱衣服图片

Clothoff.io
AI脱衣机

AI Hentai Generator
免费生成ai无尽的。

热门文章

热工具

EditPlus 中文破解版
体积小,语法高亮,不支持代码提示功能

SublimeText3 Linux新版
SublimeText3 Linux最新版

WebStorm Mac版
好用的JavaScript开发工具

禅工作室 13.0.1
功能强大的PHP集成开发环境

Atom编辑器mac版下载
最流行的的开源编辑器