分詞表示意外的標記-Golang-PHP中文網

首頁

後端開發

Golang

分詞表示意外的標記

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Feb 09, 2024 am 08:48 AM

分詞表示意外的標記

php小编小新在这里为大家介绍一种非常有趣的技术——分詞表示意外的標記。分词是自然语言处理中的一个重要任务，它将一段文本按照一定的规则进行切分，得到一系列的词语。而在分词过程中，我们有时会遇到一些特殊的情况，比如在某些词语中出现了意外的标记，这可能会对后续的处理造成困扰。因此，研究如何表示和处理这种意外的标记就变得非常重要。在本文中，我们将介绍一些常见的意外标记，并给出相应的解决方案，希望能对大家有所帮助。

问题内容

我正在玩一个分词来学习如何解析，但我无法确定为什么这是意外的。

// nolint: golint, dupl
package main

import (
    "fmt"
    "io"

    "github.com/alecthomas/participle/v2"
    "github.com/alecthomas/participle/v2/lexer"
)

var htaccesslexer = lexer.mustsimple([]lexer.simplerule{
    {"comment", `^#[^\n]*`},
    {"ident", `^\w+`},
    {"int", `\d+`},
    {"string", `("(\\"|[^"])*"|\s+)`},
    {"eol", `[\n\r]+`},
    {"whitespace", `[ \t]+`},
})

type htaccess struct {
    directives []*directive `@@*`
}

type directive struct {
    pos lexer.position

    errordocument *errordocument `@@`
}

type errordocument struct {
    code int    `"errordocument" @int`
    path string `@string`
}

var htaccessparser = participle.mustbuild[htaccess](
    participle.lexer(htaccesslexer),
    participle.caseinsensitive("ident"),
    participle.unquote("string"),
    participle.elide("whitespace"),
)

func parse(r io.reader) (*htaccess, error) {
    program, err := htaccessparser.parse("", r)
    if err != nil {
        return nil, err
    }

    return program, nil
}

func main() {
    v, err := htaccessparser.parsestring("", `errordocument 403 test`)

    if err != nil {
        panic(err)
    }

    fmt.println(v)
}

据我所知，这似乎是正确的，我期望 403 在那里，但我不确定为什么它不识别它。

编辑：我将词法分析器更改为：

var htaccessLexer = lexer.MustSimple([]lexer.SimpleRule{
    {"dir", `^\w+`},
    {"int", `\d+`},
    {"str", `("(\\"|[^"])*"|\S+)`},
    {"EOL", `[\n\r]+`},
    {"whitespace", `\s+`},
})

错误消失了，但它仍然打印一个空数组，不知道为什么。我也不确定为什么对词法分析器使用不同的值可以修复它。

解决方法

我相信我发现了问题，这是顺序，ident 通过 \w 标签在我的词法分析器中查找数字，因此这导致我的整数被标记为 ident。

我发现我必须将 quotedstrings 和 unquotedstrings 分开，否则未加引号的字符串会获取整数。或者，我可以确保它只获取非数字值，但这会错过 stringwithnum2 之类的东西

这是我的解决方案

var htaccesslexer = lexer.mustsimple([]lexer.simplerule{
    {"comment", `(?i)#[^\n]*`},
    {"quotedstring", `"(\\"|[^"])*"`},
    {"number", `[-+]?(\d*\.)?\d+`},
    {"unquotedstring", `[^ \t]+`},
    {"ident", `^[a-za-z_]`},
    {"eol", `[\n\r]+`},
    {"whitespace", `[ \t]+`},
})

type ErrorDocument struct {
    Pos lexer.Position

    Code int    `"ErrorDocument" @Number`
    Path string `(@QuotedString | @UnQuotedString)`
}

这解决了我的问题，因为它现在查找带引号的字符串，然后查找数字，然后查找不带引号的字符串。

以上是分詞表示意外的標記的詳細內容。更多資訊請關注PHP中文網其他相關文章！

陳述

本文轉載於：stackoverflow。如有侵權，請聯絡admin@php.cn刪除

Golang的影響：速度，效率和簡單性Apr 14, 2025 am 12:11 AM

goimpactsdevelopmentpositationality throughspeed，效率和模擬性。 1）速度：gocompilesquicklyandrunseff，IdealforlargeProjects.2）效率：效率：ITScomprehenSevestAndardArdardArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdArdEcceSteral Depentencies，增強的Depleflovelmentimency.3）簡單性。

C和Golang：表演至關重要時Apr 13, 2025 am 12:11 AM

C 更適合需要直接控制硬件資源和高性能優化的場景，而Golang更適合需要快速開發和高並發處理的場景。 1.C 的優勢在於其接近硬件的特性和高度的優化能力，適合遊戲開發等高性能需求。 2.Golang的優勢在於其簡潔的語法和天然的並發支持，適合高並發服務開發。

Golang行動：現實世界中的示例和應用程序Apr 12, 2025 am 12:11 AM

Golang在实际应用中表现出色，以简洁、高效和并发性著称。1)通过Goroutines和Channels实现并发编程，2)利用接口和多态编写灵活代码，3)使用net/http包简化网络编程，4)构建高效并发爬虫，5)通过工具和最佳实践进行调试和优化。

Golang：Go編程語言解釋了Apr 10, 2025 am 11:18 AM

Go語言的核心特性包括垃圾回收、靜態鏈接和並發支持。 1.Go語言的並發模型通過goroutine和channel實現高效並發編程。 2.接口和多態性通過實現接口方法，使得不同類型可以統一處理。 3.基本用法展示了函數定義和調用的高效性。 4.高級用法中，切片提供了動態調整大小的強大功能。 5.常見錯誤如競態條件可以通過gotest-race檢測並解決。 6.性能優化通過sync.Pool重用對象，減少垃圾回收壓力。